RAG与企业内部知识库AI失败的原因——比起检索精度更应优先准备的事项
本文从数据整理、权限、评估指标和运营设计的角度,解析导入企业内部文档检索与RAG却未能取得成效的原因。这是一份旨在让企业内部知识库AI不至于止步于PoC的实践指南。
企业内部知识库AI和RAG,是许多企业最容易率先尝试的AI应用。然而在实际中,往往容易遇到诸如“搜索能用,但没人用”、“回答看起来挺像那么回事但不可信”、“因担心权限管理而无法正式上线”等瓶颈。其原因不在于模型,而在于导入前的设计。
RAG与企业内部知识库AI的设计,请交给Cor.株式会社
我认为,在导入RAG时首先应该关注的不是向量数据库或模型,而是企业内部文档的状态。陈旧的资料、重复的内容、各部门之间不一致的表述、模糊的访问权限。如果对此置之不理就直接接入AI,带来的只会是更快速的混乱。
Cor.株式会社在AI受托开发、本地LLM与安全AI的背景下,从业务设计层面为涉及企业内部文档、会议纪要、规格书和报价单的AI应用提供全方位支持。
本文引用的客观数据
- IPA的《DX动向2025》指出,日本企业在利用生成式AI方面的课题包括对效果与风险的理解、管理规则与标准的建立,以及对轻信错误回答的素养层面的问题。
- OWASP将Overreliance(过度依赖)列为LLM的风险之一,并梳理指出不对LLM的输出进行批判性评估将影响决策并带来法律责任。
- Cor.官方网站介绍,在本地LLM与安全AI方面,主张不将机密数据非必要地传输至外部,并根据机密程度设计AI运营方案。
失败原因1:企业内部文档陈旧、重复
RAG是一种参考企业内部文档来生成回答的机制。也就是说,如果参考来源陈旧,它就会返回陈旧的回答。如果存在重复的资料,它就无法判断哪个是正确的;而如果各部门的格式不同,搜索结果的颗粒度也会参差不齐。
在导入AI之前需要做的,并不是追求完美无瑕的文档整理。至少要确定最新版本的存放位置、已废弃资料的处理方式、文档负责人以及更新频率。
失败原因2:权限管理模糊不清
在企业内部知识库AI中,谁能看什么至关重要。不能将全体员工都能查看的企业内部规章,与仅限部门查看的客户信息或人事信息放在同一个搜索对象中。
许多在RAG正式上线阶段停滞不前的企业,问题往往不是出在搜索精度上,而是卡在权限设计上。从PoC阶段开始,就应该明确如何按文档、文件夹以及部门维度落实访问控制。
失败原因3:评估指标停留在“感觉挺方便”
对企业内部知识库AI的评估,仅看回答是否自然是远远不够的。应该关注的指标包括回答的准确性、参考来源的呈现率、搜索时间的缩短、咨询量的减少、错误回答时的检测机制,以及用户的再次使用比例。
不能在PoC阶段以“看起来能用”草草收尾,而是需要明确究竟能减少哪项业务多少分钟的时间、减少哪类咨询多少件、在哪个部门正式上线,然后再进行验证。
RAG与企业内部知识库AI的设计,请交给Cor.株式会社
如果您希望导入企业内部文档搜索或RAG,但在文档整理、权限管理、评估指标方面心存疑虑,应当在技术选型之前先从业务设计入手。Cor.株式会社提供包括本地LLM与安全AI在内的实施落地支持。
常见问题
什么是RAG?
这是一种检索企业内部文档或外部信息,并由LLM基于检索结果生成回答的机制。其特点是不依赖模型本身的记忆,能够参考指定的信息源。
导入RAG首先应该做的是什么?
在挑选模型之前,首先要明确供其参考的文档范围、最新版本管理机制、权限以及评估指标。
本地LLM可以与RAG结合使用吗?
可以。在处理机密文档时,通过将本地LLM或封闭的搜索环境与RAG相结合,能够设计出无需将信息非必要地传输至外部的架构。
参考资料
- IPA: DX动向2025 - 日本在生成式AI方面的推进比例低于美国和德国,企业规模越小推进比例越低。课题主要在于治理、素养以及场景探索。
- OWASP Top 10 for LLM Applications - 梳理了Sensitive Information Disclosure(敏感信息泄露)、Excessive Agency(过大权限)、Overreliance(过度依赖)等LLM应用的代表性风险。
- Cor. HP: AI × CO-CREATION / 业务概况 - 了解Cor.的业务领域、Grift、本地LLM与安全AI、AI驱动开发及共创理念。
- Cor. HP: 安全 - 了解本地优先、最小化日志、机密级别梯队、AI使用方针及ISMS认证筹备情况。
Support this article
If this article was helpful, please support us with a tip. You can choose any amount.
相关文章
公司中可以与不可以输入ChatGPT的信息——机密数据AI利用的判断标准
面向犹豫是否可将合同、会议纪要、报价单、客户信息输入生成式AI的经营者及管理部门,解读机密级别的划分方法、云端AI与本地LLM的分工使用,以及完善公司内部规则的要点。
中小企业的AI引入为何进展缓慢|从总务与管理部门起步的切实可行路线图
立足于中小企业AI引入率仅为20.4%的现状,本文将解析如何从总务与管理部门轻松起步推进AI应用。适合正在探讨迈出AI应用第一步的企业阅读。
生成式AI企业内部使用规范制定指南|从OWASP与IBM调查解析风险管理
面向制定生成式AI使用规则的管理层与职能部门,梳理禁止输入信息、经批准的AI工具、日志记录、员工培训及应急响应机制。本文旨在帮助希望兼顾AI应用与信息管理的企业。