星颖资源网's Archiver
论坛首页
›
星颖筛选风向标
› 做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。
星颖
发表于
7 天前
做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。
【AI】
做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。MirroS 把 Harness 做成开源评测系统,让 Agent 自己拆任务找证据打分。评论区有人问 stateful 难题和可观测性,适合延伸成评测服务、模板或私有部署。
MysticSoul77
发表于
6 天前
看到就是学到,信息本身不难,难的是把它转成行动。
WangShuYun7
发表于
3 天前
星友前排支持,星友们的创意无限,祝项目赚得盆满钵满,顶一个!
页:
[1]
查看完整版本:
做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。