AIの引用を信頼する前に確認する
対象読者: AIを研究、執筆、学習、技術的決定、または証拠に基づく作業に使用する中級者。
AIの引用を確認するには、2つの異なる事実を確認する必要があります: 情報源が存在すること、そしてその情報源が正確な主張を支持することです。DOIの検索は最初の質問を解決できます。関連する部分のみが2番目の質問を解決できます。
最も安全なワークフローは5つのステップから成ります:
このプロセスは短い回答に対して数分で完了します。また、最も危険な2つの失敗モードを捉えます: 存在しないがもっともらしい参照と、AIの文章とは異なるか狭いことを述べる実際の情報源です。
リンクされた情報源だけでは不十分な理由
現在のAI製品はウェブを検索し、引用を添付することができます。それでも、提供者は重要な主張を確認するようにユーザーに伝えています。OpenAIの現在の正確性ガイダンスは、作成された研究、引用、参照を可能なエラーの一部としてリストし、読者に直接情報源を訪れるようにアドバイスしています。
情報源のリンクは4つのレイヤーで失敗する可能性があります:
| レイヤー | 質問 | 一般的な失敗 |
|---|---|---|
| --- | --- | --- |
| 存在 | その作品は存在しますか? | 作成されたタイトル、ジャーナル、著者、またはDOI |
| アイデンティティ | これは名付けられた作品ですか? | 間違った年、バージョン、論文、または類似のタイトルの情報源 |
| 支持 | 情報源は主張を支持しますか? | その部分は無関係、矛盾、またははるかに狭い |
| 範囲 | 結果は結論を持ち運ぶことができますか? | 小さなサンプル、異なる集団、代理指標、または欠落した制限 |
URLだけを確認すると、最後の3つのレイヤーは未解決のままです。タイトルだけを確認しても、支持と範囲は未解決のままです。
同じチェックは論文以上のものにも適用されます。製品のドキュメントへのリンクは存在するかもしれませんが、別のバージョンを説明している可能性があります。ベンチマークは異なるハードウェアやプロンプトの下でスコアを報告するかもしれません。ポリシーページは別の場所や日付をカバーしている可能性があります。
最近の研究がAIの引用について発見したこと
4つの研究が測定された失敗を実用的な推論から分離するのに役立ちます。どの引用されたAIの回答も信頼できないことを証明するものではありません。これらは一緒に、情報源のアイデンティティ、部分の支持、そして決定リスクが別々のチェックを必要とする理由を示しています。
存在しない参照が実際の論文に到達した
2026年5月の論文LLM hallucinations in the wildは、arXiv、bioRxiv、SSRN、PubMed Centralの250万件の論文にわたる1億1100万件の参照を監査しました。著者は、タイトルを学術インデックスと照合し、追加のクリーンアップと検索ステージを適用するパイプラインを使用して、2025年に146,932件の幻覚引用を推定しました。
その数は、調査されたリポジトリ内での保守的な推定です。この方法は、マイナーな作品を見逃したり、メタデータが異なる場合に記録を誤分類したりする可能性があります。存在しない参照をより直接的に検出し、間違った主張を支持するために使用された実際の論文を検出するよりも、狭い安全な結論を導きます: 偽の引用が現在実際の研究に現れています。
引用は誤った依存を増加させる可能性がある
2026年8月1日に発表された研究は、46人の医師を対象にした情報源リンク付きの臨床アシスタントをテストしました。Large language models improve physician accuracy but lead to false relianceでは、平均的な正確性はアシスタントなしで70.8%からアシスタントありで82.6%に上昇しました。認識された引用の支持は、正しいアドバイスの採用を34%から76.9%に増加させました。
同じ手がかりがリスクを生み出しました。誤ったアドバイスが支持されているように見えると、観察された決定における抵抗は92%から34.8%に減少しました。この研究は、他の仕事や日常の研究に対してその正確な効果を確立するものではありません。臨床設定、研究の順序、そして有害な決定の小さなセットは、読者が結果をどこまで拡張できるかを制限します。測定されたギャップは、引用された回答を信頼信号として扱うことに対する警告を依然として提供します。
主張レベルのチェックは視覚的検査よりも効果的
VetScoreは、8月4日にリリースされ、長い回答を主張に分割し、各主張を引用された抜粋と照合し、潜在的な危害を別々にスコアリングし、その後リスク調整された結果を計算します。著者は、獣医学の専門家からの注釈に対してコンポーネントを検証し、事実確認に対して0.78、危害スコアリングに対して0.76の相関を報告しました。
この論文は、外部検索からの事実ではなく、引用された抜粋をチェックします。省略、ヒト医学、画像入力、または実世界の結果をテストしていません。読者は、テキストを主張に分割し、各主張をチェックし、エラーが害を引き起こす可能性がある場所でより多くの時間を費やすというコアメソッドを使用できます。
洗練された報告は弱い証拠の連鎖を隠す可能性がある
HiEviDR-Benchは、証拠から中間的な主張、そして結論へのグラフとして研究を表現します。その2,000の人間検証済みの質問は、テキストとマルチモーダルな証拠をカバーしています。16のテストされたマルチモーダルモデルの中で、著者は報告の質と引用の正確性、主張の構築、回答の正確性の間にギャップを見つけました。
このベンチマークは、テストコーパスとモデルの審査者を人間のレビューとともに使用します。すべての研究ツールやライブワークフローを測定するものではありませんが、洗練された文章が弱い証拠であることを示しています。各主張をその情報源に追跡してください。
AIの引用を確認するための5ステップのワークフロー
小さな証拠台帳を使用します。スプレッドシート、メモ、または課題テンプレートが機能します。これらのフィールドを持つ各材料の主張ごとに1行を保存します:
text claim | citation as given | stable identifier | source passage | status | risk | notes
台帳は各チェックをその主張に結びつけます。また、テキストが変更されたときの監査証跡も残します。
1. 正確な主張と引用を固定する
証拠に依存する文をコピーします。修飾語、日付、数値、比較グループ、因果関係の言語を保持します。その後、AIが提示した通りに引用を正確にコピーします。
段落全体を1つの単位としてチェックするのは避けてください。文が別々の事実命題を含む場合は、それを分割します。例えば:
この文には少なくとも2つの主張が含まれています: 測定された減少とすべての業界に関する主張です。1つの情報源が最初を支持し、2番目の証拠を提供しない可能性があります。
外部の証拠を必要としない明確にラベル付けされた意見や推奨などの文はマークします。意思決定を変更する事実の主張に検証の時間を費やしてください。
2. 情報源のアイデンティティを確認する
まず安定したIDを検索します: DOI、PubMed ID、arXiv ID、標準番号、ケース番号、または公式ドキュメントのURL。タイトル、著者または機関、日付、ジャーナル、バージョンを一致させます。
CrossrefのREST APIドキュメントは、出版メンバーによって提出された記録と信頼できる情報源によって補足された記録を説明しています。そのAPIは、書誌メタデータを確認し、存在する場合は修正や出版後の更新を公開することができます。OpenAlexは、学術作品とそれらの著者、情報源、機関、トピックとの関係のオープンカタログを提供します。
これらのツールは「これは名付けられた作品ですか?」という質問に答えるのに役立ちます。「この作品は文を支持しますか?」という質問には答えません。彼らの記録は不完全または古い可能性があります。記録が一致しない場合は、出版社、会議、裁判所、規制当局、または著者の現在のバージョンを優先し、対立を記録します。
複数の安定したフィールドをチェックした後に作品を見つけられない場合は、引用を停止して拒否します。最も近いもっともらしい論文に置き換えたり、元のものが正しかったかのように振る舞ったりしないでください。
3. 一次情報源を開く
識別子に従って論文、標準、データセット、リリースノート、法令、または公式文書にアクセスします。一次情報源を見つけたり、文脈を提供するために二次記事を使用するのは構いません。
結果を読む前に、バージョンと日付を確認します。プレプリントはピアレビュー後に変更される可能性があります。製品のドキュメントは現在のリリースを説明している場合がありますが、AIの回答は古いものについて議論しているかもしれません。撤回、修正、または更新されたベンチマークは、安全な解釈を逆転させる可能性があります。
ペイウォールが完全な検証を妨げることがあります。方法、サブグループの結果、またはそれ以外の制限に依存する主張がある場合、アクセスできるのが要約のみの場合は、その主張を未確認としてラベル付けします。要約は、著者が要約することを選択した内容の証拠であり、完全な研究の代替ではありません。
4. 主張を部分とその範囲に一致させる
主張を支持すべき正確な表、図、段落、またはセクションを見つけます。それを再度見つけるための十分な文脈を記録します: ページ、セクション、表、図、または段落の見出し。
関係を分類します:
一致する文の周りを読みます。集団、サンプルサイズ、ベースライン、比較、不確実性、結果の定義、期間を確認します。相関と因果関係を分けます。数値が絶対的か相対的か、事前登録された主要な結果、探索的サブグループ、モデルシミュレーション、またはベンダーベンチマークから来たかを確認します。
技術的な主張については、モデルのバージョン、プロンプト、データ分割、ハードウェア、量子化、レイテンシパーセンタイル、コストを記録します。実際の作業のためにAIモデルをベンチマークする際にも同じチェックを使用します。
5. リスクに応じて決定する
検証の努力は、間違っていることのコストに応じて増加すべきです。低リスクの背景事実には、1つの権威ある情報源が必要な場合があります。医療、法律、財務、安全、またはセキュリティの主張には、専門家のレビュー、現在の管轄権またはバージョンの確認、独立した裏付けが必要です。
4つのアクションを使用します:
| 発見 | アクション |
|---|---|
| --- | --- |
| 情報源が存在し、スコープされた主張を直接支持する | 一次情報源を受け入れ、引用する |
| 情報源が狭い声明を支持する | 欠落した条件で書き直し、条件付きでマークする |
| 情報源が欠落、ミスマッチ、または矛盾している | 主張を削除または拒否する |
| 証拠が不明で、決定が高リスクである | 専門家に尋ねる |
支持された低リスクの主張を支持されていない高リスクの主張と平均化しないでください。VetScoreのリスク重み付けのアイデアは、手動で検証する場合でも役立ちます: 投与量、法的義務、セキュリティコントロール、財務リスク、その他の物質的な害を引き起こす可能性のある主張を優先してください。

*主張をキャプチャし、情報源のアイデンティティを確認し、一次情報源を開き、部分を一致させ、リスクによって結果をルーティングします。*
再現可能な作業例
以前の研究セクションからこの主張を取ります:
5つのチェックを実行します:
最終的な文言は、最も劇的な数値をコピーするのではなく、証拠の境界を持ちます。
自動引用チェッカーができることとできないこと
自動化は反復的なアイデンティティチェックに強力です。タイトルを正規化し、著者と年を一致させ、識別子を解決し、欠落した作品をフラグし、重複した参照を検出し、レビューのためのキューを生成することができます。
オープンソースのRefCheckerリポジトリは、Semantic Scholar、OpenAlex、Crossref、DBLP、ACL Anthologyに対するチェックを文書化しています。これは決定論的なプレフィルターとオプションのLLMベースの抽出、より深い検索を組み合わせています。このプロジェクトは、2026年8月5日にチェックしたときにアクティブで、前日のリリースとコミットがありました。その活動は、独立した正確性の証拠ではなく、継続的なエンジニアリング作業を示しています。
サポートステップには人間を保持してください。タイトルの一致は、研究の結果が別の集団に適用されるかどうかを決定できません。LLMの審査者は、回答に見られる同じ過剰な解釈を繰り返す可能性があります。フルテキストの抽出は、表、脚注、または否定を失う可能性があります。チェッカーは証拠と不確実性を返すべきであり、レビューを終了する緑のバッジを返すべきではありません。
情報源リンク付きのシステムを構築するチームは、RAG評価ワークフロー→でステージを再利用できます。テストの取得、引用の適合、主張の支持、回答の質を独自に評価します。実際のフィールドからのラベル付きの例に対して任意のスコアをキャリブレーションします。LLM信頼性キャリブレーションガイド→は、生のモデルスコアが確率ではない理由を説明しています。
再利用可能なAI引用検証チェックリスト
AI生成の情報源を引用、公開、または行動を起こす前に、各項目を確認してください:
ワークフローは真実を保証するものではありません。それは、各主張を信頼する、狭める、または破棄する理由を追跡可能にします。それは、リンクが付いているために流暢な回答を信頼するよりも強い基準です。
主張チェック
| 主張 | ステータス | 証拠の境界 |
|---|---|---|
| --- | --- | --- |
| AIシステムは研究、引用、参照を作成できます。 | 確認済み | OpenAIは制限を文書化しています; 野生の引用研究は定義された学術コーパス内の存在しない参照を測定します。 |
| DOIまたはメタデータの一致は主張の支持を証明します。 | 拒否 | 情報源のアイデンティティを確立します。関連する部分と範囲はまだチェックする必要があります。 |
| 野生の引用研究は、2025年にすべての学問で正確に146,932件の偽の引用を見つけました。 | 拒否 | 論文は、調査されたリポジトリと検出方法に対して保守的な推定を報告しています。 |
| 引用は常にAI支援の決定を安全にします。 | 拒否 | CORAは平均的な医師の正確性を向上させましたが、明らかに支持された誤ったアドバイスに対する抵抗も低下しました。 |
| CORAはすべてのドメインで同じ効果を証明します。 | 拒否 | この研究は、構造化された臨床設定で46人の医師を対象にしました。 |
| 主張の分解と抜粋の検証はテストされたパターンを形成します。 | 条件付き | VetScoreは獣医学の長文QAでパターンを検証します; 外部の事実確認と他のドメインは別の検証が必要です。 |
| プロフェッショナルな報告の質は、根拠のある証拠の集約を証明します。 | 拒否 | HiEviDR-Benchは、報告の質と引用、主張、回答の結果の間にギャップを見つけました。 |
| 自動参照一致は部分のレビューを置き換えることができます。 | 拒否 | アイデンティティチェックの作業を減らすことはできますが、すべての主張の範囲と解釈を確立することはできません。 |
