AIおよびRAG検索のためのMicrosoft Worksスプレッドシートアーカイブの準備
AI、データ、ナレッジマネジメントチームがプライベートRAGシステムを構築するためのものです。

TL;DR
LLMとRAGパイプラインは、.wks、.xlr、.wpt、または.wpsファイルを直接インデックス化することはできません。レガシースプレッドシートは、パイプラインに入る前にローカルでCSV、Markdown、およびXLSXに変換してください。CSVとMarkdownは、埋め込みおよび検索の入力として最適であり、XLSXとPDFは、モデルに表示される内容の人間による確認をサポートします。
AIは読めないものは使えない
ほとんどのリトリーバルおよび埋め込みパイプラインは、古いスプレッドシートのバイナリを静かにスキップします。その結果、会社の実際の知識の一部から質問に自信を持って答えるプライベートRAGシステムが生まれます—しばしば何が除外されたのか誰も気づかないままです。
アーカイブの近代化は、地味だが必要な前提条件です:クリーンでオープンなフォーマットが、従来のフォーマットが隠していたスプレッドシートの履歴を解放します。
RAGに最適なターゲット形式
1. タブラ埋め込みのためのCSV
CSV は最もクリーンな表形式の入力です。各行は小さく予測可能なチャンクになり、列は自然なメタデータになります。CSV をインデックス内の行レベルのメタデータと組み合わせることで、年、エンティティ、またはソースファイルでフィルタリングできます。
2. ナラティブタブ用のMarkdown
多くのMicrosoft Worksファイルには、仮定、変更履歴、エグゼクティブサマリーなどのナラティブタブが含まれています。MarkdownはHTMLやPDFのテキストよりもLLMのトークン化に適しているため、変換後に参照として使用する場合にはサマリータブの方が適しています。
3. 人間による確認のためのXLSXとPDF
レビュアーがモデルに何が示されたかを確認する必要がある場合、XLSX と PDF が彼らが期待するフォーマットです。モデルの引用を視覚的にたどれるように、CSV/Markdown の隣に置いてください。
会話を非公開にしてください
アーカイブに財務、顧客、従業員、または運用データが含まれる場合、変換はクラウドAIのステップの前に行うべきであり、できればRAGパイプラインの他の部分がホストされている同じ管理された環境内で行うのが望ましい。
無料のオンラインコンバーターは、プライバシーを重視するAIシステムにとって不適切な依存です。それらは、プライベートなLLMが排除するよう設計されている正確にそのデータ居住性の問題を再び持ち込んでしまいます。
後で役立つインデックス作成のコツ
変換中にファイルごとのメタデータを取得します:ソースパス、出力パス、元の拡張子、変換タイムスタンプ、およびフォルダ構造から推測できるプロジェクト、年、またはエンティティ。これらのメタデータをフィルタ可能なフィールドとしてベクターストアにプッシュします。
アーカイブをRAG対応と宣言する前に、いくつかの既知の歴史的な質問に対してサンプルテストを実施する。適切な質問は、インデックスに入れる必要があるタブや仮定をしばしば明らかにする。
部分的なアーカイブにRAGを構築するのをやめてください
プライベートLLMの賢さは、見ることができるコーパスに依存します。レガシーのスプレッドシートアーカイブを一度変換し、メタデータでインデックス化し、モデルに会社が実際に知っていることをついに読ませましょう。
関連記事
レガシーMicrosoft WorksアーカイブをプライベートAIコーパスの一部にする
代表的なアーカイブで Microsoft Works File Converter を試し、RAG パイプラインに取り込む準備ができた CSV、Markdown、XLSX、および PDF 出力を生成します。
無料トライアル
アプリの全機能 — 最大 10 ファイル
Windows 10 または 11
下の オフラインインストーラー をダウンロードして、最大 10 ファイルのフルトライアルをご利用ください。変換はお使いの PC 上で行われます。