EVAgent 评测
事实 · 判断 · 证据

小微 Agent 阶段性评测

小微在进步吗,和竞品差在哪里

用同一批真实 Query 和录屏证据,持续判断小微每个版本是否进步,并与持续演进的千问、阿宝、豆包比较优势与短板。

这套评测只回答两个管理问题。第一,小微在版本迭代中有没有真实进步;第二,面对持续进化的竞品,小微在哪些用户意图下更好用,优势和短板分别是什么。当前 Demo 先建立可复核的基线,后续用同一机制观察版本变化。
2

评测范围:真实 Query 与四个 Agent

从真实 Query 聚合出的 17 个场景中选取代表样本。竞品选择从 Agent DAU 与市场覆盖出发,选取用户活跃度和市场占有率较高的千问、阿宝、豆包,与小微进行固定对比。

小微核心评测对象,观察版本进步
千问高 DAU 代表性 Agent,竞品基准
阿宝高 DAU 代表性 Agent,竞品基准
豆包高 DAU 代表性 Agent,竞品基准
范围怎么选评测边界
场景
17 个核心意图
按用户最终诉求归为信息、商品、服务三类。
样本
清晰 Query + 模糊 Query
清晰样本看执行,模糊样本看理解、澄清与合理默认。
证据
真实录屏与截图
参考 Query 只用于选场景,正式判断只认录屏里实际发出的 Query。

这 17 个场景不是评测时现编的能力清单,而来自 小微数据中心 Query 分析:筛选请求 834,632 条,去重 query / 意图 333,609 条,命中意图大类正好 17 类。一级意图里点外卖 26.1%、查询服务 23.8%、买票 8.6%,代表用户实际在做什么。

小微数据中心 Query 分析:筛选请求 834632 条,命中意图大类 17 类,一级意图分布含点外卖、查询服务、买票

小微数据中心 / Query 分析。右上角「命中意图大类 17」就是后面沿用的 17 个核心场景。

绿色描边的四类,是这次已经写出场景报告的:查询服务、导航出行、点外卖、到店预约。

1

先定判断:什么叫更好用?

不做能力清单,也不把三个维度简单平均。先看结果是否完成,再看理解是否准确,最后比较过程成本。

01 · 优先判断 结果完成与准确

结果对象、关键条件和任务阶段是否正确。没办成,不能因为更快就获胜。

02 · 次级判断 意图理解

有没有理解用户要做什么,并正确处理地点、规格、时间、预算等条件。

03 · 接近时比较 过程顺畅

交互是否必要、操作是否连贯、响应是否更快。

1

有没有办成?

没办成,不能因为快就赢。千问外卖约 34 秒到付款前,但清晰 Query 里地址仍是 B6;小微约 118 秒,地址是 B4 栋 F3。结果优先,所以清晰这一维是小微更好。

2

都办成了,谁理解更准?

谁更少遗漏、误解。模糊公交查询里,千问问广州还是北京;小微把公交首班改成故宫到机场的地铁。

3

前两项接近,再看谁更省事

更少操作、更少确认、更快。模糊天气里千问多问一轮城市,这是必要澄清,不能因此判它更差。

「好用」首先是办成,其次是理解准,最后才是过程省事。

3

Demo:把录屏变成可复核结论

Demo 不追求复杂总分,而是把真实录屏转成同口径的三维对比、结论和截图证据。

EVAL DESK 四 Agent 场景评测工作台:商品交易下的点外卖,雷达图对比小微、千问、阿宝、豆包

EVAL DESK 工作台。左边选服务主体,上面选具体场景和清晰 / 模糊 Query,中间给出雷达图与「整体而言」结论。雷达图只标差异落在哪一维,权重仍是结果 > 意图 > 过程。

4

Demo 结果:点外卖四 Agent 对照

清晰 Query 看执行是否准确。模糊 Query 更能看出 Agent 处理不确定性的能力。两样本 Query 不同,不能四列加总。

点外卖的三维差异

清晰与模糊 Query 分开看。两组录屏的实际 Query 不完全相同,因此雷达图只比较各组内部表现,不把两张图合成总排名。

帮我点一份麦当劳麦辣鸡翅中套餐,1份,送到广州 TIT 创意园 B4 栋 F3。

整体而言,小微更好

从结果来看:小微最好
从意图来看:小微、豆包
从过程来看:千问

评测权重参考:结果 > 意图 > 过程

帮我点份辣一点的鸡翅套餐送过来,预算 50 元左右。

整体而言,千问更好

从结果来看:千问最好
从意图来看:千问、阿宝
从过程来看:千问

评测权重参考:结果 > 意图 > 过程

点外卖 · 清晰 Query

工作台展开详细评测后,同一句外卖会变成三维对照表,再配四家实际画面。下面这张就是点外卖清晰 Query 的分析页。

点外卖清晰 Query 详细评测:必须落实条件、三维对照表、四家 Agent 录屏截图

必须落实的条件写在最上面。意图理解、过程顺畅、结果完成三行各写谁更好、依据是什么。底部四列是录屏证据:小微抽全条件,千问地址仍显示 B6,阿宝走进店预约,豆包写明没法直接下单。

样本一实际发送:帮我点一份麦当劳双层吉士汉堡套餐,饮料选可乐去冰,送到广州 TIT 创意园 B4 栋 F3,1 份。

决定性差异在结果,不在速度

两者都进入付款前页面。小微地址是 B4 栋 F3,总额 ¥48.4。千问约 34 秒就到付款前,但配送地址仍是 tit 创意园腾讯公司 B6。报告写明:用默认账户地址覆盖当前 Query 的明确地址,存在送错风险,该问题优先级高于响应速度。按结果优先,清晰这一维小微更好。

结果完成与准确

小微订单摘要:地址为广州 TIT 创意园 B4 栋 F3,双层吉士汉堡套餐 1 份

小微 · B4 栋 F3 写进摘要

可乐仍是标准冰,小微披露小程序没有去冰选项。地址正确,支付权在用户。

千问付款卡片商品正确,配送地址仍是 B6

千问 · 商品对,地址仍是 B6

链路完成,已到支付宝付款前。关键地址错误,报告称为底线问题。

发生了什么:同一句 B4 栋 F3。小微写进订单确认页。千问沿用账户默认 B6。为什么支撑判断:商品类「完成」要求条件正确,地址错误比去冰未写入影响更大。

意图理解

小微收到完整清晰 Query:套餐、可乐去冰、B4 栋 F3、1 份

小微抽全了显式条件

品牌、套餐、数量、B4 栋 F3、去冰都识别到。

千问提示当前地址仍是 tit 创意园腾讯公司 B6

千问没有提取当前地址

商品和数量正确,但提示「当前你的地址是 B6」。当前 Query 的地址没有被当成执行条件。

过程顺畅

千问约 34 秒进入付款前,推荐门店后即可下单。小微约 118 秒,补充联系人属于必要步骤,但整体等待更长。过程这一维千问更好。它不能翻过上面的地址错误。

点外卖 · 模糊 Query

样本一实际发送:帮我点一份 30 元左右的清淡外卖送到公司,最好不要辣。缺具体商品、店家和可核验的公司门牌,应先澄清或给出少量候选。

场景结论:模糊这一维千问更好

千问展示默认公司地址 B6,给出袁记云饺、72 街荷叶饭两项候选,用户选定后进入付款前,结算价 ¥26.96。小微也进入提交订单页(华辉拉肠 ¥23.9),但未经用户选择直接决定了具体套餐,约 117 秒。报告写明:模糊 Query 更合理的终态是先给少量候选,再进入下单。

千问给出清淡不辣候选并展示公司地址 B6,保留用户选择权

千问 · 知道该问什么

识别预算、清淡、不辣。把候选摊开,没有替用户点第一项。

小微停在华辉拉肠提交订单页,套餐由 Agent 直接决定

小微 · 擅自补全套餐

自动使用微信保存地址「金颖西三街」,录屏不能证明那就是用户说的公司。套餐也是 Agent 直接决定的。

发生了什么:同一句「送到公司」。千问把地址摊开并给候选。小微替用户选了店、选了菜。为什么支撑判断:模糊 Query 测的是知不知道缺什么,以及有没有擅自替用户决定关键条件。

样本二模糊:预算匹配不等于办成

样本二是「辣一点的鸡翅套餐,预算 50 元左右」。阿宝给出华莱士香辣鸡翅套餐 30.9 元,匹配辣味和预算;点开入口后,淘宝闪购列表出现北京王府井门店。豆包约 15 秒出推荐,再次声明没法直接下单。结果完成与准确:没有完成方。

阿宝打开淘宝闪购后出现北京王府井门店列表

阿宝 · 套餐对,落在错城

对话里预算和口味匹配。入口未带入华莱士,列表是北京王府井。

豆包模糊外卖仍声明没法直接下单,只给文本搭配

豆包 · 快,但没有交易入口

按约 50 元偏辣搭配。停在纯文本,需要用户自己去第三方下单。

5

当前阶段:小微的优势与竞品差距

不给脱离场景的总排名。回答小微在哪类任务上更强、强在哪一维,以及下一版最需要补齐什么。

当前结论

小微在清晰任务的条件识别与可核验执行上有优势,例如外卖地址写入订单、导航进入地图页;主要短板集中在模糊意图处理、跨轮上下文污染和响应时间。千问在交易与服务履约上更稳定,豆包在信息结果完整性上更强,阿宝响应快但结果稳定性不足。当前仅能建立版本基线,是否“进步”需要下一版本按同一批样本复测。

哪类任务上谁更强?

任务类别场景谁更强
信息
查询服务(天气)
豆包(清晰、模糊都更好)
信息
导航出行
小微(清晰)、千问(模糊)
商品
点外卖
千问更强(有限优势)
服务
到店预约
千问(清晰、模糊都更好)

信息类:查询服务豆包全胜,导航清晰小微、模糊千问。服务类是千问。商品类千问更强,但是有限优势。

强在哪里?

豆包 · 结果完成与准确

结果给全,来源可核验

天气清晰给全 7 天表,模糊一轮给齐当前+未来 6 天。意图理解上清条件抽得全(外卖品牌/套餐/地址全对)。过程也快,12–19 秒一轮。

千问 · 结果完成与准确 + 过程顺畅

四家里唯一稳定到达可办理/付款前页

到店预约进飞猪「订」,点外卖两次进付款前,35 秒内完成。意图理解擅长模糊澄清:缺城市/线路先问、给候选、保留用户选择权。

小微 · 结果完成与准确 + 意图理解

清晰条件能写进可核验处

导航进腾讯地图,外卖 B4 栋 F3 写进订单确认页。条件抽取严谨,模糊会先问门票类型。过程顺畅弱,30–120 秒。

阿宝 · 过程顺畅 + 意图理解

响应最快,模糊预算能对上

13–15 秒一轮文字。华莱士 30.9 元匹配辣味与预算。结果完成与准确只在到店预约清晰并列露脸(携程广州塔页,票档加载中)。

主要短板是什么?

Agent短板报告中的例子
小微
模糊意图下沿用上文、擅自替用户决定
公交首班被改成地铁;外卖直接替用户选套餐;天气城市被定位覆盖成海珠区。响应慢。
千问
显式条件可能被默认值覆盖
点外卖明确地址 B4 栋 F3 被默认账户地址 B6 覆盖。送错风险,底线问题。
豆包
服务 / 交易履约闭环弱
外卖明说「没法直接下单支付」;预约只给攻略;导航终态停在步行页签。
阿宝
结果不完整、易落错对象、流程易卡
天气只给 3 天;模糊预约落南越王闭园页;外卖落北京王府井错城;堂食搜店无结果。

四 Agent 能力画像

小微

清晰任务执行强,模糊易擅自补全

面对模糊意图容易擅自补全:不澄清就自己猜、替用户决定。响应慢。

千问

交易 / 服务履约强

显式地址可能被默认值覆盖。

豆包

信息获取强

交易闭环弱。

阿宝

响应快

结果完整性与稳定性不足。

严格边界

每场景每清晰度目前 1 个样本。「商品类千问更强」是跨样本推断(千问与豆包未同组直比)。以上均可回到四份报告:查询服务.md、导航出行.md、到店预约-广州塔.md、点外卖.md。

6

下一步:形成横向与纵向比较机制

同一周期横向比较不同 Agent,连续周期纵向观察小微变化,让竞品差距和版本进步都能被持续追踪。

横向与纵向比较

横向回答同一周期里哪个 Agent 更好用,纵向回答小微随版本和周期是否持续进步。

横向 · Agent 比较在同一周期、同一实际 Query 和同一评测口径下,对比小微、千问、阿宝、豆包,判断哪个 Agent 更好用,以及差异出现在哪个维度。
纵向 · 周期变化按周期复测同类意图,比较小微当前周期与上一周期的表现,持续观察意图理解、过程顺畅、结果完成与准确的进步或退步。
比较方向固定产出回答的问题
横向
Agent 对照报告
同一意图下,小微与千问、阿宝、豆包相比谁更好用,优势和短板分别是什么。
纵向
周期变化报告
小微相对上一周期在哪些意图、哪些维度进步或退步,问题是否得到修复。

横向看小微与竞品的差距,纵向看小微随周期的变化。

依据

  1. 评测结果 / 查询服务.md:整体而言,豆包更好。
  2. 评测结果 / 导航出行.md:整体而言,小微、千问更好。
  3. 评测结果 / 到店预约-广州塔.md:整体而言,千问更好。
  4. 评测结果 / 点外卖.md:千问更强(有限优势)。这是跨样本推断,千问与豆包未同组直比。
  5. 评测结论.md 与 cells-overlay.json:工作台格子已评状态。买票已有单格报告,本文综合结论不引用,避免超出指定的四份场景报告。
  6. 小微数据中心 Query 分析:筛选请求 834,632 条,命中意图大类 17。这是 17 个场景的来源,不是评测结果。