内容摘要: 关于动态模型路由的新研究证实了一项让 AI 智能体具备经济可行性的关键策略。企业必须从使用单一强大 AI 模型演进为协调管理一系列多样化模型,根据复杂性路由任务,从而在不牺牲质量的前提下大幅削减成本。


1. 执行摘要

企业领导者渴望部署复杂的 AI 智能体来自动化处理多步骤的复杂工作流。然而,一个巨大的障碍摆在面前:高昂的成本。如果这些智能体完全依赖 GPT-4 或 Claude 3 等前沿模型运行,可能会产生不可持续的推理费用,从而将强大的自动化功能局限于少数高价值的用例。然而,最近的一篇论文指明了一条更务实、更具可扩展性的前进道路。这篇题为 AgentRouter:为实现成本最优的多步智能体工作流而设计的异构模型路由 的研究,介绍了一种系统,它能在一个智能体工作流中,智能地将子任务路由到能够处理该任务且最具成本效益的模型。据报道,这种动态模型路由方法可将成本削减高达 72%,同时保持超过 97% 的输出质量。

我们相信,这项研究为我们一直向客户倡导的战略转型提供了关键的验证。企业 AI 智能体架构的未来不是单体的,而是一个协同工作的异构模型集群。通过将单个用户请求视为一系列独立的子任务——有些简单,有些复杂——组织可以部署混合了大型、强大模型和更小、更快、更便宜的模型。这就为“AI 交通控制”创造了一个全新的、至关重要的基础设施层,该层能同时优化性能和成本,将曾经的经济障碍转变为竞争优势。

这一转变对企业应如何思考其 AI 战略具有深远影响。它将焦点从简单地挑选“最佳”模型,转移到设计一个能在每个时刻使用正确模型的智能系统。这需要一种更复杂的 MLOps、治理和架构方法,但回报是巨大的:能够可持续地、大规模地部署强大的 AI 智能体。对于首席信息官 (CIO) 和首席技术官 (CTO) 来说,信息很明确:现在就是开始构建您的 AI 模型集群和管理它的路由智能的时候了。

核心要点:

  • 大幅降低成本: 据报道,动态路由可将智能体工作流成本降低 72%,使以前无法负担的用例在经济上变得可行。
  • 架构转变: 主流范式将从依赖单一前沿模型转变为协调管理一个由大型和小型模型组成的多样化集群。
  • 新的基础设施要求: 企业必须投资于一个路由或编排层来管理这种“混合模型”方法,这为 AI 工程创造了一个新的焦点。
  • 解锁可扩展的自动化: 这种成本优化策略是将 AI 智能体从有限的试点项目推向广泛的企业级部署的关键。

2. 超越单体架构:AI 模型集群的崛起

许多观察者对这一发展的理解忽略了一点,即动态模型路由不仅仅是一种简单的成本节约策略。它代表了我们对应用 AI 理解的根本性成熟。最初那种为每个任务都使用最强大模型的冲动,是一种源于技术新颖性的简单粗暴的方法。AgentRouter 的概念展示了一条通往更优雅、更高效的工程准则的道路。其核心洞见在于,一个复杂任务的不同部分难度并不相同。一个分析客户支持工单的工作流可能包括一个简单的分类步骤(低复杂度)、一个提取关键细节的步骤(中等复杂度),以及最后起草一份细致入微、富有同理心的回复(高复杂度)。对这三个步骤都使用前沿模型是极大的浪费。

这种“混合模型”策略类似于一个运营良好的专业服务团队。你不会指派一位高级合伙人去复印文件,也不会让一个初级分析师去构建一个数十亿美元的并购案。你会根据技能、成本和期望结果,将合适的资源分配给合适的任务。这里的路由系统就是项目经理。这种方法也是在 Mixtral 等模型内部看到的专家混合 (MoE) 架构的自然延伸,但它被应用于跨一组独立模型的集群。正如麦肯锡指出,管理 AI 成本是企业最关心的问题之一,而这种架构模式提供了一个直接的解决方案。

构建这种能力需要将思维方式从模型消费转变为系统设计。工程团队不再仅仅是管理一个指向单一供应商的 API 密钥,而是必须构建一个模型组合——包括一些专有模型、一些开源模型和一些专用模型——以及协调它们的逻辑。这个路由层成为一项关键的知识产权和竞争差异化的来源。掌握了这一点的组织不仅能控制成本,还能获得灵活性、减少供应商锁定并提高整体系统弹性。这是迈向成熟的智能体 AI 实施方法的关键组成部分,超越了简单的提示工程,进入了构建稳健、自动化系统的新阶段。

考量因素当前/传统方法Thinkia 推荐方法预期影响
模型策略单体式:对工作流中的所有任务使用一个前沿模型。异构集群:使用一个模型组合(大型、小型、专用型)。复杂工作流的推理成本降低 50-75%。
成本模型按次调用定价,每一步成本都很高。按工作流的混合成本,为整体效率进行优化。AI 服务的运营支出可预测且更低。
基础设施单一 API 端点集成。一个智能的路由和编排层。更大的架构灵活性和更少的供应商锁定。
成功指标不计成本的原始输出质量或准确性。每个成功结果的质量调整后成本。将 AI 投资与业务价值和投资回报率直接挂钩。

3. 构建您的 AI 交通控制塔

企业领导者现在必须从理论转向实践。实施动态模型路由策略并非易事;它需要在技术、治理和人才方面进行周密的规划。第一步是认识到,路由系统本身就是一个关键的基础设施,需要像其他任何企业系统一样,经过严谨的设计、构建和管理。它是您 AI 运营的“大脑”,实时做出关于成本、质量和延迟的决策。

对于 CIO 和 CTO 而言,这意味着要将 MLOps 的职能扩展到包括“路由运维 (router-ops)”。您的团队需要持续地针对一组代表性的子任务,对模型组合进行基准测试,以便为路由系统的决策引擎提供数据。这个引擎可以从一个简单的基于规则的系统开始(例如,“如果任务是分类,使用模型 A;如果是摘要,使用模型 B”),然后演变成一个复杂的、由机器学习驱动的控制器,该控制器能根据实时输入预测最佳模型。这是一个重大的工程挑战,但它会在运营效率上带来丰厚回报。

至关重要的是,这种新架构引入了新的治理问题。您如何管理路由系统将敏感数据发送到安全性较低的模型的风险?当涉及多个模型时,您如何审计端到端的决策过程?您的 AI 治理与风险 框架必须扩展到覆盖整个模型集群及其管理路由逻辑。这包括为哪些模型被批准用于哪些类型的数据和任务建立明确的策略,并确保对每个路由事务都有完整的审计跟踪。

要开启这段旅程,我们建议采用分阶段的方法:

  1. 解构与分类: 首先审计一个高流量、高成本的智能体工作流。将其分解为各个子任务,并按复杂性(例如,低、中、高)对每个子任务进行分类。这一分析构成了您路由策略的基础。
  2. 对多样化的组合进行基准测试: 不要再局限于前沿模型之间的简单对比。评估一系列模型,包括像 Llama 3 8B 或 Phi-3 这样较小的开源选项,专门针对您分类的子任务进行测试。不仅要衡量质量,还要衡量成本和延迟。
  3. 构建一个简单的路由原型: 为已审计的工作流构建一个概念验证的路由层。从一个静态的、基于规则的方法开始,以快速证明其价值。这将为构建一个更动态、更智能的系统提供商业论证。
  4. 演进您的治理框架: 更新您的模型风险管理政策,以明确处理多模型环境。定义将新模型添加到集群的标准以及对路由逻辑本身所需的监督。

5. 常见问题解答

问:构建一个模型路由系统不就是增加另一个需要管理的复杂系统吗?

答: 是的,它确实引入了一个新的架构组件,但这是一种能带来显著回报的可控复杂性。相比之下,不受控制的、单体式的模型使用方式从长远来看成本更高,可扩展性也更差。这个路由层集中了对成本和性能的控制,比各个团队分散、临时地选择模型要高效得多。

问:我们如何为我们的模型集群选择合适的模型组合?

答: 您的模型组合应直接反映您最常见的企业用例。分析构成您关键工作流的子任务(例如,数据提取、分类、摘要、内容生成),并选择一系列在这些特定任务上,在不同成本和性能层级都表现良好的模型。

问:这种方法会增加还是减少供应商锁定?

答: 它从根本上减少了对单一前沿模型供应商的锁定。通过在您的应用程序和模型之间构建一个抽象层(即路由系统),您可以灵活地更换、添加或移除来自任何供应商的模型,而无需重新设计您的应用程序。这增强了您的议价能力和运营弹性。

问:开始使用动态模型路由最实际的第一步是什么?

答: 确定一个高流量的工作流,其中子任务的复杂性有明显差异。一个典型的例子是客户咨询处理:一个简单、便宜的模型可以对咨询类型进行分类,而一个更强大的模型则负责生成细致入微的回复。实施这样一个两步路由是一个可控的项目,能够迅速证明投资回报率。


6. 结论

用暴力方式应用 AI 的时代——即为每个可能的任务都使用最大、最昂贵的模型——正在走向终结。AgentRouter 所展示的原则标志着企业 AI 进入下一个成熟阶段:构建智能、高效且具有成本意识的系统。动态模型路由不仅仅是一个功能;对于任何认真考虑大规模部署 AI 智能体的组织来说,它都是一个核心的架构模式。

通过从单体策略转向受管理模型集群,企业可以释放智能体自动化的全部潜力,而不会承受不可持续的运营成本。这需要在新基础设施上进行战略投资,并采用更复杂的治理方法,但这是使复杂 AI 成为广泛创造价值的资产的唯一可行路径。我们帮助客户设计和构建这些下一代 AI 平台,确保他们的 AI 投资不仅强大,而且实用且有利可图。