小微 Agent 阶段性评测
小微在进步吗,和竞品差在哪里
用同一批真实 Query 和录屏证据,持续判断小微每个版本是否进步,并与持续演进的千问、阿宝、豆包比较优势与短板。
SCENES
评测范围:真实 Query 与四个 Agent
从真实 Query 聚合出的 17 个场景中选取代表样本。竞品选择从 Agent DAU 与市场覆盖出发,选取用户活跃度和市场占有率较高的千问、阿宝、豆包,与小微进行固定对比。
这 17 个场景不是评测时现编的能力清单,而来自 小微数据中心 Query 分析:筛选请求 834,632 条,去重 query / 意图 333,609 条,命中意图大类正好 17 类。一级意图里点外卖 26.1%、查询服务 23.8%、买票 8.6%,代表用户实际在做什么。
小微数据中心 / Query 分析。右上角「命中意图大类 17」就是后面沿用的 17 个核心场景。
绿色描边的四类,是这次已经写出场景报告的:查询服务、导航出行、点外卖、到店预约。
先定判断:什么叫更好用?
不做能力清单,也不把三个维度简单平均。先看结果是否完成,再看理解是否准确,最后比较过程成本。
结果对象、关键条件和任务阶段是否正确。没办成,不能因为更快就获胜。
有没有理解用户要做什么,并正确处理地点、规格、时间、预算等条件。
交互是否必要、操作是否连贯、响应是否更快。
有没有办成?
没办成,不能因为快就赢。千问外卖约 34 秒到付款前,但清晰 Query 里地址仍是 B6;小微约 118 秒,地址是 B4 栋 F3。结果优先,所以清晰这一维是小微更好。
都办成了,谁理解更准?
谁更少遗漏、误解。模糊公交查询里,千问问广州还是北京;小微把公交首班改成故宫到机场的地铁。
前两项接近,再看谁更省事
更少操作、更少确认、更快。模糊天气里千问多问一轮城市,这是必要澄清,不能因此判它更差。
「好用」首先是办成,其次是理解准,最后才是过程省事。
Demo:把录屏变成可复核结论
Demo 不追求复杂总分,而是把真实录屏转成同口径的三维对比、结论和截图证据。
17 类里选一个,再选清晰或模糊 Query。
四个 Agent 的真实操作过程,不是参考答案。
参考 Query 只定义测试场景。正式判断以录屏里实际发送的为准。
输出雷达图、结论和截图证据。
EVAL DESK 工作台。左边选服务主体,上面选具体场景和清晰 / 模糊 Query,中间给出雷达图与「整体而言」结论。雷达图只标差异落在哪一维,权重仍是结果 > 意图 > 过程。
Demo 结果:点外卖四 Agent 对照
清晰 Query 看执行是否准确。模糊 Query 更能看出 Agent 处理不确定性的能力。两样本 Query 不同,不能四列加总。
点外卖的三维差异
清晰与模糊 Query 分开看。两组录屏的实际 Query 不完全相同,因此雷达图只比较各组内部表现,不把两张图合成总排名。
帮我点一份麦当劳麦辣鸡翅中套餐,1份,送到广州 TIT 创意园 B4 栋 F3。
整体而言,小微更好
从结果来看:小微最好
从意图来看:小微、豆包
从过程来看:千问
评测权重参考:结果 > 意图 > 过程
帮我点份辣一点的鸡翅套餐送过来,预算 50 元左右。
整体而言,千问更好
从结果来看:千问最好
从意图来看:千问、阿宝
从过程来看:千问
评测权重参考:结果 > 意图 > 过程
点外卖 · 清晰 Query
工作台展开详细评测后,同一句外卖会变成三维对照表,再配四家实际画面。下面这张就是点外卖清晰 Query 的分析页。
必须落实的条件写在最上面。意图理解、过程顺畅、结果完成三行各写谁更好、依据是什么。底部四列是录屏证据:小微抽全条件,千问地址仍显示 B6,阿宝走进店预约,豆包写明没法直接下单。
样本一实际发送:帮我点一份麦当劳双层吉士汉堡套餐,饮料选可乐去冰,送到广州 TIT 创意园 B4 栋 F3,1 份。
两者都进入付款前页面。小微地址是 B4 栋 F3,总额 ¥48.4。千问约 34 秒就到付款前,但配送地址仍是 tit 创意园腾讯公司 B6。报告写明:用默认账户地址覆盖当前 Query 的明确地址,存在送错风险,该问题优先级高于响应速度。按结果优先,清晰这一维小微更好。
结果完成与准确
小微 · B4 栋 F3 写进摘要
可乐仍是标准冰,小微披露小程序没有去冰选项。地址正确,支付权在用户。
千问 · 商品对,地址仍是 B6
链路完成,已到支付宝付款前。关键地址错误,报告称为底线问题。
发生了什么:同一句 B4 栋 F3。小微写进订单确认页。千问沿用账户默认 B6。为什么支撑判断:商品类「完成」要求条件正确,地址错误比去冰未写入影响更大。
意图理解
小微抽全了显式条件
品牌、套餐、数量、B4 栋 F3、去冰都识别到。
千问没有提取当前地址
商品和数量正确,但提示「当前你的地址是 B6」。当前 Query 的地址没有被当成执行条件。
过程顺畅
千问约 34 秒进入付款前,推荐门店后即可下单。小微约 118 秒,补充联系人属于必要步骤,但整体等待更长。过程这一维千问更好。它不能翻过上面的地址错误。
点外卖 · 模糊 Query
样本一实际发送:帮我点一份 30 元左右的清淡外卖送到公司,最好不要辣。缺具体商品、店家和可核验的公司门牌,应先澄清或给出少量候选。
千问展示默认公司地址 B6,给出袁记云饺、72 街荷叶饭两项候选,用户选定后进入付款前,结算价 ¥26.96。小微也进入提交订单页(华辉拉肠 ¥23.9),但未经用户选择直接决定了具体套餐,约 117 秒。报告写明:模糊 Query 更合理的终态是先给少量候选,再进入下单。
千问 · 知道该问什么
识别预算、清淡、不辣。把候选摊开,没有替用户点第一项。
小微 · 擅自补全套餐
自动使用微信保存地址「金颖西三街」,录屏不能证明那就是用户说的公司。套餐也是 Agent 直接决定的。
发生了什么:同一句「送到公司」。千问把地址摊开并给候选。小微替用户选了店、选了菜。为什么支撑判断:模糊 Query 测的是知不知道缺什么,以及有没有擅自替用户决定关键条件。
样本二是「辣一点的鸡翅套餐,预算 50 元左右」。阿宝给出华莱士香辣鸡翅套餐 30.9 元,匹配辣味和预算;点开入口后,淘宝闪购列表出现北京王府井门店。豆包约 15 秒出推荐,再次声明没法直接下单。结果完成与准确:没有完成方。
阿宝 · 套餐对,落在错城
对话里预算和口味匹配。入口未带入华莱士,列表是北京王府井。
豆包 · 快,但没有交易入口
按约 50 元偏辣搭配。停在纯文本,需要用户自己去第三方下单。
当前阶段:小微的优势与竞品差距
不给脱离场景的总排名。回答小微在哪类任务上更强、强在哪一维,以及下一版最需要补齐什么。
小微在清晰任务的条件识别与可核验执行上有优势,例如外卖地址写入订单、导航进入地图页;主要短板集中在模糊意图处理、跨轮上下文污染和响应时间。千问在交易与服务履约上更稳定,豆包在信息结果完整性上更强,阿宝响应快但结果稳定性不足。当前仅能建立版本基线,是否“进步”需要下一版本按同一批样本复测。
哪类任务上谁更强?
信息类:查询服务豆包全胜,导航清晰小微、模糊千问。服务类是千问。商品类千问更强,但是有限优势。
强在哪里?
结果给全,来源可核验
天气清晰给全 7 天表,模糊一轮给齐当前+未来 6 天。意图理解上清条件抽得全(外卖品牌/套餐/地址全对)。过程也快,12–19 秒一轮。
四家里唯一稳定到达可办理/付款前页
到店预约进飞猪「订」,点外卖两次进付款前,35 秒内完成。意图理解擅长模糊澄清:缺城市/线路先问、给候选、保留用户选择权。
清晰条件能写进可核验处
导航进腾讯地图,外卖 B4 栋 F3 写进订单确认页。条件抽取严谨,模糊会先问门票类型。过程顺畅弱,30–120 秒。
响应最快,模糊预算能对上
13–15 秒一轮文字。华莱士 30.9 元匹配辣味与预算。结果完成与准确只在到店预约清晰并列露脸(携程广州塔页,票档加载中)。
主要短板是什么?
四 Agent 能力画像
清晰任务执行强,模糊易擅自补全
面对模糊意图容易擅自补全:不澄清就自己猜、替用户决定。响应慢。
交易 / 服务履约强
显式地址可能被默认值覆盖。
信息获取强
交易闭环弱。
响应快
结果完整性与稳定性不足。
每场景每清晰度目前 1 个样本。「商品类千问更强」是跨样本推断(千问与豆包未同组直比)。以上均可回到四份报告:查询服务.md、导航出行.md、到店预约-广州塔.md、点外卖.md。
下一步:形成横向与纵向比较机制
同一周期横向比较不同 Agent,连续周期纵向观察小微变化,让竞品差距和版本进步都能被持续追踪。
横向与纵向比较
横向回答同一周期里哪个 Agent 更好用,纵向回答小微随版本和周期是否持续进步。
横向看小微与竞品的差距,纵向看小微随周期的变化。
依据
- 评测结果 / 查询服务.md:整体而言,豆包更好。
- 评测结果 / 导航出行.md:整体而言,小微、千问更好。
- 评测结果 / 到店预约-广州塔.md:整体而言,千问更好。
- 评测结果 / 点外卖.md:千问更强(有限优势)。这是跨样本推断,千问与豆包未同组直比。
- 评测结论.md 与 cells-overlay.json:工作台格子已评状态。买票已有单格报告,本文综合结论不引用,避免超出指定的四份场景报告。
- 小微数据中心 Query 分析:筛选请求 834,632 条,命中意图大类 17。这是 17 个场景的来源,不是评测结果。