|
|
【AI】
企业内部知识库开始从“资料搜索”变成 Agent 基础设施
赛道:AI Agent / 企业知识库 / 内部搜索 / MCP 工具
案例描述:Cerebras 公开了他们内部知识库的搭建方式,员工、自动化流程和 AI agents 每天会向它提问 15,000+ 次,已经变成公司内部高频基础设施。X 上有开发者把 Cerebras 的思路迁移到自己公司 Databricks 上的知识库系统里:把 Slack、会议纪要等文档先用 LLM 蒸馏成“可能被搜索的问题 / 摘要 / 解决方案 / 系统名”,再进入索引。一天内完成计划、实现和测量。
数据/来源:Cerebras 官方文章发布后,X 上复现案例显示:全量 825 个文档,Golden QA 20 问测试,hit@5 从 55% 提升到 90%;正文词汇问题从 0/9 提升到 8/9;耗时 1 天。复现帖目前约 1409 views、1 like、6 bookmarks。
评论区信号:Cerebras 的官方工程实践已经被外部开发者迁移到 Databricks + Slack/会议纪要场景,并且能用一天跑出可量化提升。说明它不是大厂专属架构,而是可以产品化/服务化的 SOP。
为什么是机会:很多公司现在都有一堆散落在飞书、Slack、企微、Notion、会议纪要、CRM、工单、代码仓库里的知识,但内部搜索很弱。过去大家会本能地上向量库、RAG、embedding,但这个案例的核心不是“更复杂的搜索技术”,而是“索引前的数据蒸馏”。先把原始对话变成别人未来会问的问题,再让搜索命中这些问题。
可复刻方向:给中小公司做内部知识库体检,用 20 个 Golden QA 测 hit@5;给飞书/企微/Slack/会议纪要做蒸馏索引层;做律所案例库、售后工单库、销售话术库、研发事故库、客服 SOP 库;或者做 MCP 搜索工具,让 Claude Code / Codex / 企业 Agent 能查公司内部知识。
风险:企业数据权限和隐私是核心门槛。必须处理 ACL、PII 脱敏、数据源权限同步、错误引用和过期知识。不要一上来卖“大而全知识库”,更适合先从客服、销售、研发事故、会议纪要搜索这类高频场景切入。
|
|