普遍观点
在企业AI领域,主流的说法是,复杂的提示工程是释放基础模型全部潜力的关键。由供应商和顾问放大的共识观点是,在提示中提供更详细、更具上下文的信息几乎总能带来更好、更准确的输出。这导致许多组织将提示工程作为核心竞争力进行大量投资,认为这是实现价值最直接的途径。然而,最近一项严谨的研究《从提示级上下文看,边际词错误率未见可检测变化》,挑战了这一假设,凸显了在实际应用中提示工程的真实局限性。
我们的立场 提示工程并非万能药。对于专业化、高风险的企业任务,其效益会遇到一个硬性上限,而实证验证表明,它可能会分散我们对微调等更有效方法的注意力。
数据究竟揭示了什么
Theodore O. Cochran等人的研究提供了一个关键的“无效结果”——即未发现任何效果,这往往比一个积极的结果更能说明问题。研究人员在处理一项困难的现实世界任务时,测试了包括GPT-4o和Gemini-2.5-Flash在内的领先多模态模型:转录大量已损坏的口述历史音频。他们系统地提供了提示级上下文,例如关于说话者和主题的信息,期望看到词错误率(WER)的下降。结果是明确的:转录准确性没有统计上可检测到的改善。增加的上下文根本没有帮助。
这并非模型本身的失败,而是清楚地表明,提示的好处是特定于领域的,并且无法保证。在清晰、定义明确的任务中,上下文可能非常强大。但在嘈杂、专业的领域——企业经常遇到的那种——来自简单提示上下文的信号可能会被淹没。这与我们观察到的一个更广泛的趋势相符,即通用模型正在为解决高价值问题让位于更专业的垂直AI解决方案。科学界明白,无效结果对进步至关重要,因为它们可以防止研究人员走入死胡同,这是企业AI领域需要迅速内化的一课。
真正的启示
对企业领导者而言,真正的启示是,过度依赖提示工程是一种脆弱的策略。它助长了一种基于传闻证据和无休止调整的文化,而非系统性的改进。当一个模型在专业任务上失败时,默认的反应变成了“我们试试另一个提示”,而不是去问提示工程到底是不是适合这项工作的工具。这种方法消耗了宝贵的时间和资源,同时制造了一种虚假的进步感。
将提示工程视为灵丹妙药的组织,正冒着将关键工作流程建立在不稳固基础上的风险。他们将不可避免地遇到一个性能瓶颈,无论怎样精心设计提示都无法克服。与此同时,那些投资于更稳健方法的竞争对手——例如在特定领域数据上微调模型或实施严格的验证框架——将基于卓越、可靠的AI性能建立起持久的竞争优势。
应该怎么做
企业领导者必须转变观念。我们建议不要将提示工程视为一门战略性学科,而应将其视为一种基线能力——一个起点,而非终点。第一步是建立实证验证的文化。在部署任何由AI驱动的解决方案之前,定义明确的成功指标,并使用您自己的数据对模型进行测试。其次,对于涉及专业数据的关键、高价值用例,领导者应从一开始就假定需要更先进的技术。这意味着您必须构建一个优先的AI采纳路线图,为微调和其他模型适应方法分配预算和资源。目标是从问“这次提示奏效了吗?”转变为问“我们如何证明这个系统性能可靠,以及当提示不够用时我们的计划是什么?”
