AI論文サーベイを壊さないRAG設計 ― 検索・引用・検証を分ける

プロンプト・LLM活用

この記事について
この記事は、生成AIを活用した自動生成フローで作成しています。arXiv APIの公式資料とReciprocal Rank Fusion(RRF)の原論文情報を確認し、旧記事の架空論文ID・仮想性能値を削除しました。

検証ステータス:✅ arXiv公式API資料・RRF一次文献確認済み

AIに「この分野の最新論文をまとめて」と頼むだけでは、論文名、著者、実験値、引用元が混ざりやすくなります。論文サーベイを安定させるには、生成モデルの賢さよりも、検索・本文・引用・検証を別工程にすることが重要です。

まず論文メタデータを生成させない

arXivはAPIを公開しており、タイトル、著者、arXiv ID、公開・更新日、要約などをプログラムから取得できます。これらをLLMに推測させず、APIやデータベースから取得した値を正本にします。

最低限、各文書に次の情報を持たせます。

  • 一意なpaper ID / arXiv ID
  • タイトル・著者
  • 公開日・バージョン
  • 取得元URL
  • 本文チャンクとページ・セクション情報

Hybrid Retrievalは「検索漏れを減らすための候補」

検索では、キーワード一致に強いsparse retrievalと、意味的な近さを見るdense retrievalを組み合わせる方法があります。両者のランキングを統合する手法の一つがReciprocal Rank Fusion(RRF)です。

RRFはCormack、Clarke、Buettcherが2009年に発表したランキング融合手法で、複数の検索システムが返した順位を比較的単純な式で統合します。

RRF(d) = Σ 1 / (k + rank_r(d))

ただし、Hybrid RetrievalやRRFを入れれば自動的に「忠実性が何%上がる」「処理時間が何%下がる」とは言えません。検索対象、埋め込みモデル、分割方法、reranker、評価セットによって結果は変わります。

生成前に「根拠付きの材料表」を作る

いきなりサーベイ本文を書かせる代わりに、まず次のような中間データを作ります。

{
  "claim": "提案手法Aは評価条件Bで改善した",
  "paper_id": "xxxx.xxxxx",
  "evidence": "原文の該当箇所",
  "location": "Section 4 / Table 2"
}

ここで根拠が見つからない主張は「不明」のままにし、LLMに補完させません。

サーベイ生成は最後

  1. APIや検索システムから候補論文を取得する。
  2. タイトル・著者・IDを固定する。
  3. 本文からテーマに関係する箇所を抽出する。
  4. 各主張にsource IDと根拠箇所を結び付ける。
  5. 重複・矛盾する結果を整理する。
  6. 材料表だけを入力にして本文を生成する。
  7. 生成後、数値・論文名・引用をもう一度sourceへ突き合わせる。

評価も2つに分ける

評価 見るもの
Retrieval評価 必要な論文・根拠チャンクを検索できたか
Generation評価 取得した根拠から逸脱せず文章化できたか

この2つを混ぜると、「検索で落としている」のか「LLMが書き間違えた」のか切り分けにくくなります。

一次情報

この記事の更新履歴

  • 2026-09-14 追加:arXiv APIを正本にする設計、根拠付き中間データ、検索と生成を分けた評価を追加。
  • 2026-09-14 変更:Hybrid RAG万能論から、検索・引用・検証を分離する再現可能な論文調査フローへ変更。
  • 2026-09-14 削除:内部style_prompt、本文H1、存在しないarXiv:2404.XXXXX、内部試算の30%高速化、仮想性能表を削除。

文書情報

記事タイトル
AI論文サーベイを壊さないRAG設計 ― 検索・引用・検証を分ける
作成日
更新日
Source URL
https://papanda925.com/?p=5470

ライセンス: 本記事のうち、当サイトが権利を有する本文・自作図表は、特記なき限り CC BY 4.0 で利用できます。生成AIを活用して作成・編集した内容を含みます。コードについて、別途ライセンス表示またはリンク先GitHubリポジトリのライセンスがある場合は、その条件を優先します。引用・第三者資料・画像・商標等は本ライセンスの対象外です。 利用ポリシー

タイトルとURLをコピーしました