📖 导读:阅读本文你将获得:
  • 看清Agent从POC到生产的真实瓶颈——不是模型,不是成本
  • 理解「可观测性89% vs 评估52%」背后的37个百分点鸿沟
  • 拿到一套Agent工程成熟度五级自检框架
  • 看到万人企业与百人公司在Agent落地上的关键差异
  • 知道Agent评估的三种主流方法各自适合什么场景

LangChain在2026年6月发布了一份调研报告,调查了1340位专业人士。其中一个数字让我不太舒服——

89%的团队已经部署了Agent可观测能力,但只有52%建立了系统评估。 也就是说,将近三分之一的团队「看得见Agent在跑」,却「测不准它跑得对不对」。

这不是个别现象。调研显示,57%的团队已经把Agent推进了生产环境。Agent不再是一个「要不要做」的问题,而是一个「怎么做对」的问题。

但「怎么做对」这四个字,很多人理解偏了。

AI Agent生产落地数据墙
图1:LangChain 2026年千人调研核心数据(1,340位专业人士,覆盖科技/金融/医疗/教育等行业)

质量问题不是模型问题

调研中最扎眼的数据是这个:32%的团队把「质量」列为Agent上生产的头号障碍。这个比例连续两年排名第一,而且还在上升。

很多人看到这个数据的第一反应是:「模型不行。」

但如果你仔细看调研里的细分数据,会发现另一个事实——

10,000+员工的大企业里,质量依然是第一障碍,但第二名变了:安全(24.9%)。 而在100人以下的小公司里,第二名是延迟(20%)。大企业担心Agent会泄露数据、违反合规;小公司头疼的是Agent响应太慢,用户等不了。

两个群体对「质量」的定义也不一样。万人企业的填写回复里,最频繁出现的词是「幻觉」和「输出一致性」——Agent有时候答对,有时候答错,同一个问题问两遍给两个答案。这对面向客户的场景是致命的。

3M在部署AI辅助客服时就遇到过这个问题。有用户问「3M的历史」,Agent回答「3M有80年历史」——但3M成立于1902年,到2026年已经超过120年。这种事实性错误在客服场景里,一次就够了。

可观测性vs评估鸿沟
图2:可观测性与评估之间的37个百分点鸿沟——「看得见」不等于「测得准」

看得见,但测不准

这就是那37个百分点鸿沟的真实含义。

可观测性解决的是「Agent做了什么」——每一步推理、每一次工具调用、每一个中间结果,都能追踪到。LangChain的数据显示,89%的团队已经部署了可观测能力,生产环境下更是高达94%。71.5%有完整的链路追踪。

但评估解决的是「Agent做得对不对」——它给出的答案是准确的吗?它的行为符合品牌规范吗?它的决策逻辑是可解释的吗?这个问题,只有52%的团队在回答。更扎心的是,在线评估(实时监控Agent在真实用户面前的表现)只有37.3%。

换句话说:大多数团队能看到Agent在跑,但不知道它跑得好不好。

这就好比你给一辆车装了行车记录仪,能拍到每一秒的画面。但你没装碰撞测试——你不知道这辆车在事故中能不能保护乘客。

评估的三条路

调研里还有一个有意思的发现:评估Agent质量的方法正在分化。

Agent评估方法矩阵
图5:三种评估路径并行——人工审核、LLM-as-Judge、传统ML指标各有适用场景

第一条路:人工审核(59.8%)。最传统也最可靠。让真人检查Agent的输出,判断准确性、语气、合规性。适合高风险场景——面向客户的回答、涉及品牌的表述、需要主观判断的内容。缺点是慢、贵、不可规模化。

第二条路:LLM-as-Judge(53.3%)。用另一个AI来评判Agent的输出。规模化能力强,可以同时检查成千上万条输出。适合事实准确性验证、规则一致性检查。但它本质上还是一个模型在评判另一个模型——「用AI审AI」的天花板在哪里,目前还没有共识。

第三条路:传统ML指标(低于10%)。ROUGE、BLEU这类经典的文本相似度指标。调研显示采用率很低,原因也简单——Agent的输出是开放式的,不像翻译任务有标准答案。多个有效回答并存时,BLEU分数毫无意义。

29.5%的团队完全不做评估。这不是「还没来得及」,是根本没有这个意识。

大企业卡安全,小公司卡速度

企业规模与落地障碍对比
图4:万人企业vs百人公司——质量是共同底线,但第二优先级截然不同

调研按企业规模拆了数据,差异很明显。

2000人以上的企业里,安全(24.9%)排在第二位。大企业有合规团队、有数据安全制度、有客户隐私保护要求——Agent如果在回答中泄露了内部数据,或者输出了违反合规的内容,后果不是道歉就能解决的。

万人企业的填写回复里反复出现「幻觉」和「一致性」这两个词。他们不怕Agent慢,怕的是Agent不靠谱。谷轮在部署内部知识助手时就定了一条铁律:任何涉及产品参数的回答,必须附带来源链接。宁可答「我不确定」,也不能编造一个数字。

百人公司的情况不同。延迟(20%)排第二——小公司的Agent往往直接面对终端用户,响应速度直接影响转化率。用户不会等30秒才看到一个回答。爱优特在部署获客Agent时做过测试:响应时间从8秒降到3秒,用户留存率提升了22%。

成本焦虑为什么退潮了?

质量障碍vs成本下降趋势
图3:质量成为第一拦路虎,成本焦虑正在退位

调研里有一个反直觉的变化:成本从前几年的前三名掉到了第四位。

原因不复杂——模型降价了。GPT-4o的API价格在两年内降了超过80%,开源模型(Llama、Qwen)在很多任务上已经够用。成本不再是「能不能用」的问题,而是「怎么用好」的问题。

这个转变意味着什么?

Agent的竞争力正在从「便宜」转向「好用」。 谁能让Agent稳定、准确、可控地完成任务,谁就赢了。而不是谁的API调用最便宜。

IDC预测2026年中国企业级AI智能体市场规模将达到449亿元,同比增长110%。市场在爆发,但爆发的基础不是「AI便宜了」,而是「AI可靠了」。可靠性的来源不是更好的模型,而是更好的工程。

Agent工程成熟度:你在哪一层?

Agent工程成熟度阶梯
图6:五级成熟度模型——从盲飞到可信,每一级都有明确的能力要求

基于调研数据和我们自己的部署经验,我整理了一个Agent工程成熟度框架:

L0 盲飞——上线即交付,没有追踪、没有评估、没有监控。出了问题靠用户投诉发现。调研里29.5%的团队在这个阶段。

L1 可见——部署了可观测能力,能看到Agent的每一步推理。知道它做了什么,但不确定做得对不对。这是大多数团队(约37%)当前的位置。

L2 可评——建立了离线评估体系,能用测试集回放Agent的行为,打分、对比、发现退化。52.4%的团队到达了这一层。

L3 可控——在线评估+实时监控,Agent在真实用户面前的表现能被即时检测。出了问题能自动报警。37.3%的团队在这里。

L4 可信——评估闭环+人工兜底+持续迭代。Agent的质量不是一次达标的,而是一个持续改进的过程。这是终极目标,目前只有约24%的团队接近这个水平。

57%的团队已经在L1以上。但从「可见」到「可信」,中间隔的不是技术,是纪律。

别盯着模型,盯着工程

调研最后有一个数据让我印象深刻:75%以上的团队在生产环境中使用多个模型。OpenAI的GPT仍然是主流,但Gemini、Claude、开源模型都在被使用。团队会根据任务的复杂度、成本、延迟要求,把任务路由到不同的模型。

这说明什么?

模型的选择已经不是核心问题了。真正的问题是:你有没有一套工程体系,让这些模型在你的业务场景里稳定地工作。

这套工程体系包括:

可观测性——Agent的每一步推理、每一次工具调用都能被追踪和审计

评估体系——离线测试集+在线实时监控,两种手段缺一不可

人工兜底——高风险场景必须有人工审核环节,不能完全自动化

持续迭代——Agent的质量不是上线那天决定的,是上线之后每天优化的结果

这不是什么新道理。软件工程搞了几十年的CI/CD、代码审查、自动化测试、监控告警——Agent工程需要同样的纪律,只是换了一个载体。

32%的团队说质量是最大障碍。但质量不是障碍,质量是结果。真正的原因是:你有没有把Agent当成一个需要工程纪律来对待的系统,而不是一个调一下prompt就能上线的工具。

谁拖慢了智能体?不是模型,不是成本,不是工具链。

是缺少工程纪律的我们自己。

淇经服务的客户都在关注这些问题

3M · 谷轮 · 思帕 · 爱优特 · M77 · 香奈艺居 · 百世集团 —— 从全球500强到国内头部品牌,Agent的可靠性工程已经成为企业AI落地的核心议题。

如果你的团队也在面对「Agent上了生产但质量不稳定」的困境,淇经的FDE团队可以帮你从架构层面诊断问题、建立评估体系。

觉得有用?分享给你团队里负责AI落地的同事

保存这篇文章,下次Agent出问题时翻出来对照

全文完

淇经数科 · Qijing Digital | AI Agent 部署与交付

本文同步自淇经数科公众号(2026-09-12-谁拖慢了智能体-AI),文中数据与案例以真实交付为准。

想知道 AI 现在怎么介绍你的品牌?免费获取《品牌 AI 可见度诊断报告》:AI 说了什么、说错在哪、同行占了多少位置。

获取诊断