论文检索粒度变了 AI引用终于能逐条溯源
论文检索粒度变了 AI引用终于能逐条溯源

做检索增强生成的人对"引用幻觉"应该不陌生:模型回答里给出的参考文献,看着像模像样,点开 DOI 却经常对不上内容,甚至整篇论文都不存在。问题出在检索粒度上——传统文献检索返回的是论文列表,模型拿到的是整篇论文的语义,它自己决定引用哪一句,错了也没人拦得住。
AskChem 这个新系统换了个思路:检索单位不再是论文,而是论文里拆出来的"主张"(claim)。
检索单位从论文变成主张
AskChem 把每篇论文转换成结构化的原子级主张,每个主张附带来源 DOI 和原文引用或定位信息。目前已经索引了 240 万条主张,覆盖 14.7 万篇论文。检索时直接命中"某篇论文在某个位置说了某个结论",证据是现成的,不用再回到全文里翻。

对做 AI 文献综述、知识库、Agent 检索的人来说,工作流的变化很直接:原来"检索论文→人工拼接证据→验证来源",变成"检索主张→直接拿到带定位的证据"。中间最耗时的验证步骤被省掉了。
测试数据也支持这个方向。在 AskChem-Bench 上,GPT-5.5 配合 AskChem 检索后,DOI 解析率达到 100%,没有检索时是 88.3%。需要说明的是,测试只对比了 GPT-5.5 这一个模型,其他模型的表现没有覆盖。
对做 Agent 的人来说,这个差异会直接体现在工作流上。传统检索给 Agent 的是一篇论文,Agent 要自己判断"哪一段支撑了我的回答",判断错了引用就错了;主张级检索给 Agent 的是一个已经定位好的结论,引用路径是预先铺好的。系统还支持把相关主张组织成证据图谱,回答"这篇论文和那篇论文是什么关系"这类问题时,不用逐篇翻全文。检索从"给资料"变成了"给结论和出处"。
真正的成本在索引侧
主张级检索的代价,不在查询端,在建库端。
把论文拆成主张、给每个主张挂 DOI 和原文定位,这是一次性的结构化加工,工作量比论文级索引高一个量级。存储和检索的复杂度也会跟着涨。论文没有给出检索速度、资源消耗的实测数据,这部分目前是未知数。
更大的不确定性在于主张拆分的质量。240 万条主张靠什么流程拆出来的、不同论文类型(会议论文、预印本)是否都能覆盖、主张与原文的映射错误率有多少,论文都没有评估。如果拆分本身有噪声,"检索到的主张"就只是"看起来可靠"。
值得先验证再接入
这类"结论级检索"基建如果做扎实,对 RAG 的引用可靠性是实打实的提升——本质是把人工整理证据的力气前置到建库阶段,让每次检索都能拿到带出处的结论。这个方向值得关注。
但对想接入的团队,我的建议是先小范围验证主张拆分的准确率,再决定是否替换现有检索管线。索引规模不是价值本身,结构化质量才是。另外,新论文持续进入后,与已有主张之间的重叠、矛盾如何处理,增量更新怎么维护,目前也没有公开信息说明。这些是决定这套基建能不能长期跑下去的问题。
关于维基框架
维基框架关注企业应用开发中的长期维护问题。在实际项目中,业务系统往往同时涉及权限、微服务、接口协议、部署环境等复杂因素,因此我们希望提供一套更容易扩展和维护的基础框架。
- 官网:https://framewiki.com
- Gitee:https://gitee.com/wiki-framework
- GitHub:https://github.com/wiki-framework
- 示例项目:https://gitee.com/cdkjframework/framewiki-example
- 📄 许可证:MulanPSL-2.0(木兰宽松许可证,第2版)