工作流哪里变了
LangSmith evaluation 把 datasets、evaluators 和 experiment results 放进产品迭代流程,适合把客户失败案例沉淀为可重复评估。
垂直 Agent 不应只用 demo prompt 验证,要把真实误答、超时、工具失败和人工接管案例变成评估样本。
工具名不是结果
评估集来自失败,才有商业价值。垂直服务类信号需要回到真实行业任务里看:用户原本怎么完成这件事,AI 又是否真的降低了交付成本或决策成本。
这条信号的价值在于拆清真实任务、交付物和验收标准,而不是只展示一个案例。
先核对权限和失败
- 从最近 20 次失败里抽 5 个场景,写成输入、期望结果、判分规则和复查日期
- 先选一个服务场景验证输入、交付物、验收标准和人工复核,不要把信号提前包装成完整服务线
哪些还要核验
没有评估集,版本升级只是在换模型,不能证明质量变好。原始来源保留在文末,方便把公告事实、证据和本站判断分开看。