選定理由
Amazonが出したRAGの論文、GAFAの戦略・方向性を知りたい。
Paper:
概要
従来の「retrieve-then-read」型RAGを拡張し、「prepare-then-rewrite-then-retrieve-then-read(PR3)」 という新たなワークフローを提案している。この手法は、文書のメタデータ生成や合成QA(質問応答)を活用し、検索精度と網羅性を向上させる。多様な分野に適用可能であり、専門領域特化型の検索システムを構築せずとも高精度な検索が実現できる。
【提案手法のポイント】
文書前処理フェーズ(Prepare)
- 各文書に対してメタデータを生成。
- 文書内容を基に合成QA(質問応答ペア)を作成し、文書の内容を要約・整理。
- 合成QAはChain of Thought (CoT) プロンプトを用いて生成し、横断的な情報取得を容易にする。
- 各文書に対してメタデータを生成。
クエリ拡張フェーズ(Rewrite)
- ユーザーのクエリに対してメタデータを参照し、関連するQAや要約を用いてクエリを拡張。
- メタデータ単位でクラスター化した知識要約「Meta Knowledge Summary (MK Summary)」を活用し、
クエリの精度を向上させる。
- ユーザーのクエリに対してメタデータを参照し、関連するQAや要約を用いてクエリを拡張。
検索・読み取りフェーズ(Retrieve & Read)
- 拡張されたクエリを使い、合成QAベースで検索を実施。
- 文書チャンクではなくQA単位で検索することで、文脈の喪失を防止し、
より具体的な検索結果を取得。
- 検索結果から必要な情報をLLMが読み取り、最終回答を生成する。
- 拡張されたクエリを使い、合成QAベースで検索を実施。
実験
実験条件
データセット
- arXiv APIを使用し、2024年の最新論文2000本を取得
- 文書全体で約35Mトークンの規模
合成QAの生成
- 各文書からメタデータと合成QAを生成。
- 合計で8657件のQAペアが作成され、
70%の文書で5~6件のQA、21%の文書で2件のQAが生成された。
- QA生成にはClaude 3 Haikuを使用し、Chain of Thought (CoT) プロンプトを活用。
- 各文書からメタデータと合成QAを生成。
クエリと検索プロセス
- 評価用として200件のクエリをClaude 3 Sonnetで生成。
- 提案手法と従来手法(文書チャンク型RAG)を比較。
- 比較対象には以下の4種類のアプローチを用いた:
- 従来の文書チャンク型RAG(クエリ拡張なし)
- チャンク型RAG + クエリ拡張
- 合成QAを用いた検索(MKなし)
- 合成QA + MK Summary(提案手法)
- 従来の文書チャンク型RAG(クエリ拡張なし)
- 評価用として200件のクエリをClaude 3 Sonnetで生成。
メトリクス
- 再現率(Recall):関連する情報をどれだけ網羅的に取得できたか。
- 適合率(Precision):取得した情報の正確性と無関係な文書の排除率。
- 網羅性(Breadth):質問に対して多角的かつ幅広い観点から情報が得られているか。
- 深さ(Depth):詳細な分析や深いレベルの知識が含まれているか。
- 関連性(Relevance):ユーザーニーズに対してどれだけ適切な情報が提供されているか。
- 特異性(Specificity):クエリに対して具体的かつ的確な応答が得られているか。
実験結果
提案手法は従来手法と比較して、以下のような改善が確認された。
| 指標 | チャンク型RAG (従来) | チャンク型 + クエリ拡張 | 合成QA (MKなし) | 合成QA + MK (提案手法) |
|---|---|---|---|---|
| 再現率(Recall) | 77.76% | 82.27% | 86.33% | 88.39% |
| 適合率(Precision) | 86.91% | 87.09% | 90.04% | 90.40% |
| 特異性(Specificity) | 71.51% | 74.86% | 79.64% | 83.03% |
| 網羅性(Breadth) | 67.32% | 79.77% | 84.55% | 87.09% |
| 深さ(Depth) | 65.62% | 72.41% | 78.08% | 80.84% |
| 関連性(Relevance) | 81.51% | 85.08% | 88.92% | 90.22% |
考察
- 提案手法は特に網羅性(Breadth)と深さ(Depth)で従来手法を20%以上上回る結果を示した。
- 再現率(Recall)と特異性(Specificity)も高く、横断的な知識合成が効果的に行われていることが確認された。
- 適合率(Precision)は従来手法との差が小さいが、これはQAベースの検索がそもそも精度が高いためと考えられる。
- 合成QA + MK Summary(提案手法)が特に多面的な回答を提供し、
深く包括的な検索結果を実現している点が評価された。
コストと実行時間
2000本の論文処理コストは約20ドル(Amazon Bedrock経由でClaude 3 Haikuを使用)1件あたりのクエリ処理は約20〜25秒で完了し、リアルタイムでの運用にも耐えうる。
SOCIAL SHARE CARD GENERATOR