在信任AI引用之前进行验证
受众: 使用AI进行研究、写作、学习、技术决策或基于证据的工作的中级读者。
要验证AI引用,需要确认两个独立的事实:来源存在,并且来源支持确切的声明。DOI查找可以解决第一个问题。只有相关段落才能解决第二个问题。
最安全的工作流程有五个步骤:
这个过程对于简短的答案只需几分钟。它还可以捕捉到两种最危险的失败模式:一个看似合理但从未存在的引用,以及一个真实来源所说的内容比AI的表述更狭窄或不同。
为什么一个链接的来源不够
当前的AI产品可以搜索网络并附上引用。它们的提供者仍然告诉用户检查重要声明。OpenAI目前的准确性指南列出了虚构的研究、引用和参考文献作为可能的错误,然后建议读者直接访问来源。
一个来源链接可能在四个层面上失败:
| 层面 | 问题 | 常见失败 |
|---|---|---|
| --- | --- | --- |
| 存在 | 该工作存在吗? | 虚构的标题、期刊、作者或DOI |
| 身份 | 这是所述的工作吗? | 错误的年份、版本、论文或类似标题的来源 |
| 支持 | 来源支持该声明吗? | 段落无关、矛盾或范围过窄 |
| 范围 | 结果能支持结论吗? | 样本小、不同人群、代理指标或缺失的限制 |
仅检查URL会使最后三个层面未解决。仅检查标题仍然会使支持和范围未解决。
同样的检查适用于不仅仅是论文。指向产品文档的链接可能存在,但描述的是另一个版本。基准可能在不同的硬件或提示下报告分数。政策页面可能涵盖其他地点或日期。
最近研究发现的AI引用
四项研究帮助将测量失败与实际推理分开。没有一项证明每个引用的AI答案都是不可靠的。它们共同表明,来源身份、段落支持和决策风险需要单独检查。
不存在的引用已出现在真实论文中
2026年5月的论文LLM hallucinations in the wild审核了arXiv、bioRxiv、SSRN和PubMed Central中的1.11亿个引用,涵盖250万篇论文。作者估计2025年有146,932个虚构的引用,使用了一种将标题与学术索引匹配并应用额外清理和搜索阶段的管道。
这个数字是研究库内的保守估计。该方法可能会遗漏冷门作品,并在元数据不同的情况下错误分类记录。它比检测用于支持错误声明的真实论文更直接地检测不存在的引用。安全的结论是狭窄的:虚假引用现在出现在真实研究中。
引用可能增加错误依赖
2026年8月1日发布的一项研究测试了一个与46名医生相关的源链接临床助手。在大型语言模型提高医生准确性但导致错误依赖中,平均准确性从没有助手的70.8%上升到有助手的82.6%。感知的引用支持使正确建议的采用率从34%增加到76.9%。
同样的提示也带来了风险。当错误建议看似得到支持时,观察到的决策中的抵抗率从92%降至34.8%。该研究并未为其他工作或日常研究建立确切的效果。其临床设置、研究顺序和有限的有害决策集限制了读者对结果的扩展。测量的差距仍然警告不要将引用的答案视为信任信号。
声明级检查比视觉检查效果更好
VetScore于8月4日发布,将长答案分解为声明,检查每个声明与引用摘录的匹配,单独评分潜在危害,然后计算风险调整结果。作者根据兽医专家的注释验证了组件,并报告了针对事实验证的相关性高达0.78,针对危害评分的相关性高达0.76。
该论文检查引用摘录,而不是来自外部搜索的事实。它不测试遗漏、人类医学、图像输入或现实世界结果。读者仍然可以使用其核心方法:将文本分解为声明,检查每个声明,并在错误可能导致危害的地方花费更多时间。
精致的报告可能隐藏弱证据链
HiEviDR-Bench将研究表示为从证据到中间声明再到结论的图形。其2000个经过人类验证的问题涵盖文本和多模态证据。在16个测试的多模态模型中,作者发现报告质量与引用准确性、声明构建和答案正确性之间存在差距。
该基准使用测试语料库和模型评审者以及人类审查。它并未测量每个研究工具或实时工作流程。它确实表明,精致的散文是薄弱的证据。追踪每个声明回到其来源。
验证AI引用的五步工作流程
使用一个小的证据分类账。电子表格、笔记或问题模板都可以。每个材料声明存储一行,包含以下字段:
text claim | citation as given | stable identifier | source passage | status | risk | notes
该分类账将每个检查与其声明关联。它还在文本更改时留下审计轨迹。
1. 冻结确切的声明和引用
复制依赖于证据的句子。保留限定词、日期、数字、比较组和因果语言。然后准确地复制AI呈现的引用。
避免将整个段落作为一个单位进行检查。当句子包含独立的事实命题时,将其拆分。例如:
这个句子包含至少两个声明:一个是测量的下降,另一个是关于所有行业的声明。一个来源可能支持第一个,但对第二个没有提供证据。
标记不需要外部证据的陈述,例如明确标记的意见或建议。将验证时间花在可能改变决策的事实声明上。
2. 确认来源身份
首先搜索一个稳定的ID:DOI、PubMed ID、arXiv ID、标准号、案件号或官方文档URL。匹配标题、作者或机构、日期、期刊和版本。
Crossref的REST API文档描述了由出版成员提交并由可信来源补充的记录。其API可以确认书目元数据,并在存在时暴露更正或出版后更新。OpenAlex提供了一个开放的学术作品目录及其与作者、来源、机构和主题的连接。
这些工具有助于回答:“这是所述的工作吗?”它们并不回答:“这项工作支持该句子吗?”它们的记录可能不完整或过时。如果记录不一致,优先考虑出版商、会议、法院、监管机构或作者的当前版本,并记录冲突。
当您在检查多个稳定字段后无法找到该工作时,请停止并拒绝该引用。不要用最接近的合理论文替代它,并假装原始是正确的。
3. 打开主要来源
通过标识符找到论文、标准、数据集、发布说明、法规或官方文档。仅使用二次文章来定位或为主要来源提供背景。
在阅读结果之前检查版本和日期。预印本在同行评审后可能会发生变化。产品文档可以描述当前版本,而AI答案讨论的是旧版本。撤回、更正或更新的基准可能会逆转安全解释。
付费墙可能会阻止完全验证。当您只能访问摘要,而声明依赖于方法、子组结果或其外部的限制时,将声明标记为未验证。摘要是作者选择总结的证据,而不是完整研究的替代品。
4. 将声明与段落及其范围匹配
找到应该支持声明的确切表格、图形、段落或部分。记录足够的上下文以便再次找到它:页面、部分、表格、图形或段落标题。
对关系进行分类:
阅读匹配句子的周围内容。检查人群、样本大小、基线、比较、不确定性、结果定义和时间段。将相关性与因果关系分开。确认数字是绝对的还是相对的,以及它是否来自预注册的主要结果、探索性子组、模型仿真或供应商基准。
对于技术声明,记录模型版本、提示、数据分割、硬件、量化、延迟百分位和成本。在为实际工作基准测试AI模型→时使用相同的检查。
5. 根据风险做出决定
验证工作量应随着错误成本的增加而增加。一个低风险的背景事实可能只需要一个权威来源。医疗、法律、金融、安全或安全声明需要专家审查、当前管辖权或版本检查,以及独立证实。
使用四个行动:
| 发现 | 行动 |
|---|---|
| --- | --- |
| 来源存在并直接支持规定的声明 | 接受并引用主要来源 |
| 来源支持更狭窄的声明 | 重新写入并标记为限定 |
| 来源缺失、不匹配或矛盾 | 删除或拒绝该声明 |
| 证据仍然不明确且决策风险高 | 请教主题专家 |
不要将支持的低风险声明与不支持的高风险声明平均。VetScore中的风险加权理念在这里很有用,即使您手动验证:优先考虑剂量、法律责任、安全控制、财务风险和其他可能造成实质性危害的声明。

*捕获声明,确认来源身份,打开主要来源,匹配段落,并根据风险路由结果。*
可重复的工作示例
以早期研究部分的这一声明为例:
进行五项检查:
最终措辞承载了证据边界,而不是复制最戏剧化的数字。
自动引用检查器能做什么和不能做什么
自动化在重复的身份检查方面表现强劲。它可以规范标题、匹配作者和年份、解析标识符、标记缺失的工作、检测重复引用,并生成审查队列。
开源的RefChecker库记录了针对Semantic Scholar、OpenAlex、Crossref、DBLP和ACL Anthology的检查。它结合了确定性的预过滤器和可选的基于LLM的提取和更深入的搜索。该项目在2026年8月5日检查时仍在活跃,前一天有发布和提交。这一活动显示了持续的工程工作,而不是独立的准确性证明。
在支持步骤中保持人类。标题匹配无法决定一项研究的结果是否适用于另一种人群。LLM评审者可能会重复答案中发现的相同过度扩展。全文提取可能会丢失表格、脚注或否定。检查器应返回证据和不确定性,而不是结束审查的绿色徽章。
构建源链接系统的团队可以在RAG评估工作流程→中重用这些阶段。单独测试检索、引用适配、声明支持和答案质量。根据真实领域的标记示例校准任何分数。LLM置信度校准指南→解释了为什么原始模型分数不是概率。
可重用的AI引用验证检查表
在引用、发布或采取行动之前,请确认每个项目:
该工作流程无法保证真相。它为信任、缩小或丢弃每个声明创建了可追溯的理由。这比仅仅因为流利的答案附带链接而信任要强。
声明检查
| 声明 | 状态 | 证据边界 |
|---|---|---|
| --- | --- | --- |
| AI系统可以虚构研究、引用和参考文献。 | 已验证 | OpenAI记录了该限制;wild-citations研究测量了在定义的学术语料库中不存在的引用。 |
| DOI或元数据匹配证明声明支持。 | 被拒绝 | 它确立了来源身份。相关段落和范围仍然必须检查。 |
| wild-citations研究发现2025年在所有学术中有146,932个虚假引用。 | 被拒绝 | 该论文报告了其研究库和检测方法的保守估计。 |
| 引用总是使AI辅助决策更安全。 | 被拒绝 | CORA提高了平均医生准确性,但也测量了对明显支持的错误建议的较低抵抗。 |
| CORA在每个领域证明了相同的效果。 | 被拒绝 | 该研究涉及46名医生在结构化的临床环境中。 |
| 声明分解和摘录验证形成了经过测试的模式。 | 限定 | VetScore在兽医长格式QA中验证了该模式;外部事实检查和其他领域需要单独验证。 |
| 专业报告质量证明了扎实的证据聚合。 | 被拒绝 | HiEviDR-Bench发现报告质量与引用、声明和答案结果之间存在差距。 |
| 自动引用匹配可以替代段落审查。 | 被拒绝 | 它可以减少身份检查工作,但无法建立每个声明的范围和解释。 |
