星颖 发表于 7 天前

做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。

【AI】

做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。MirroS 把 Harness 做成开源评测系统,让 Agent 自己拆任务找证据打分。评论区有人问 stateful 难题和可观测性,适合延伸成评测服务、模板或私有部署。

















MysticSoul77 发表于 6 天前

看到就是学到,信息本身不难,难的是把它转成行动。

WangShuYun7 发表于 3 天前

星友前排支持,星友们的创意无限,祝项目赚得盆满钵满,顶一个!
页: [1]
查看完整版本: 做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。