この記事について
この記事は、生成AIを活用した自動生成フローで作成しています。arXiv APIの公式資料とReciprocal Rank Fusion(RRF)の原論文情報を確認し、旧記事の架空論文ID・仮想性能値を削除しました。検証ステータス:✅ arXiv公式API資料・RRF一次文献確認済み
AIに「この分野の最新論文をまとめて」と頼むだけでは、論文名、著者、実験値、引用元が混ざりやすくなります。論文サーベイを安定させるには、生成モデルの賢さよりも、検索・本文・引用・検証を別工程にすることが重要です。
まず論文メタデータを生成させない
arXivはAPIを公開しており、タイトル、著者、arXiv ID、公開・更新日、要約などをプログラムから取得できます。これらをLLMに推測させず、APIやデータベースから取得した値を正本にします。
最低限、各文書に次の情報を持たせます。
- 一意なpaper ID / arXiv ID
- タイトル・著者
- 公開日・バージョン
- 取得元URL
- 本文チャンクとページ・セクション情報
Hybrid Retrievalは「検索漏れを減らすための候補」
検索では、キーワード一致に強いsparse retrievalと、意味的な近さを見るdense retrievalを組み合わせる方法があります。両者のランキングを統合する手法の一つがReciprocal Rank Fusion(RRF)です。
RRFはCormack、Clarke、Buettcherが2009年に発表したランキング融合手法で、複数の検索システムが返した順位を比較的単純な式で統合します。
RRF(d) = Σ 1 / (k + rank_r(d))
ただし、Hybrid RetrievalやRRFを入れれば自動的に「忠実性が何%上がる」「処理時間が何%下がる」とは言えません。検索対象、埋め込みモデル、分割方法、reranker、評価セットによって結果は変わります。
生成前に「根拠付きの材料表」を作る
いきなりサーベイ本文を書かせる代わりに、まず次のような中間データを作ります。
{
"claim": "提案手法Aは評価条件Bで改善した",
"paper_id": "xxxx.xxxxx",
"evidence": "原文の該当箇所",
"location": "Section 4 / Table 2"
}
ここで根拠が見つからない主張は「不明」のままにし、LLMに補完させません。
サーベイ生成は最後
- APIや検索システムから候補論文を取得する。
- タイトル・著者・IDを固定する。
- 本文からテーマに関係する箇所を抽出する。
- 各主張にsource IDと根拠箇所を結び付ける。
- 重複・矛盾する結果を整理する。
- 材料表だけを入力にして本文を生成する。
- 生成後、数値・論文名・引用をもう一度sourceへ突き合わせる。
評価も2つに分ける
| 評価 | 見るもの |
|---|---|
| Retrieval評価 | 必要な論文・根拠チャンクを検索できたか |
| Generation評価 | 取得した根拠から逸脱せず文章化できたか |
この2つを混ぜると、「検索で落としている」のか「LLMが書き間違えた」のか切り分けにくくなります。
一次情報
- arXiv ― API User’s Manual
- Cormack et al. ― Reciprocal rank fusion outperforms condorcet and individual rank learning methods
この記事の更新履歴
- 2026-09-14 追加:arXiv APIを正本にする設計、根拠付き中間データ、検索と生成を分けた評価を追加。
- 2026-09-14 変更:Hybrid RAG万能論から、検索・引用・検証を分離する再現可能な論文調査フローへ変更。
- 2026-09-14 削除:内部style_prompt、本文H1、存在しないarXiv:2404.XXXXX、内部試算の30%高速化、仮想性能表を削除。

