Inizio/Blog/IA / RAG
IA / RAG5 min di lettura

Preparazione degli archivi di fogli di calcolo Microsoft Works per la ricerca AI e RAG

Per team di AI, dati e gestione della conoscenza che costruiscono sistemi RAG privati.

·Dal team di WorksConverter
Preparazione degli archivi di fogli di calcolo Microsoft Works per la ricerca AI e RAG

TL;DR

I pipeline LLM e RAG non possono indicizzare direttamente i file .wks, .xlr, .wpt o .wps. Converti i vecchi fogli di calcolo localmente in CSV, Markdown e XLSX prima che entrino nel pipeline. CSV e Markdown sono gli input migliori per embedding e retrieval; XLSX e PDF supportano la revisione umana di ciò che viene mostrato al modello.

L'IA non può usare ciò che non può leggere

La maggior parte dei flussi di lavoro di recupero e embedding ignora silenziosamente i vecchi file binari di fogli di calcolo. Il risultato è un sistema RAG privato che risponde con sicurezza alle domande su una parte della conoscenza effettiva dell'azienda, spesso senza che nessuno si renda conto di ciò che è stato escluso.

Modernizzare l'archivio è la condizione preliminare poco glamorosa ma necessaria: formati puliti e aperti sbloccano la storia dei fogli di calcolo che i formati legacy tenevano nascosta.

I migliori formati target per RAG

1. CSV per l'embedding tabellare

CSV è l'input tabellare più pulito. Ogni riga diventa un piccolo frammento prevedibile; le colonne diventano metadati naturali. Abbina CSV con metadati a livello di riga nell'indice per filtrare per anno, entità o file di origine.

2. Markdown per schede narrative

Molti file Microsoft Works includono schede narrative—ipotesi, registri delle modifiche, sintesi esecutive. Markdown è più amichevole alla tokenizzazione LLM rispetto al testo HTML o PDF, quindi le schede di sintesi costituiscono citazioni migliori dopo la conversione.

3. XLSX e PDF per la revisione umana

Quando un revisore ha bisogno di vedere cosa è stato mostrato al modello, XLSX e PDF sono i formati che si aspettano. Tienili accanto a CSV/Markdown in modo che le citazioni del modello possano essere tracciate visivamente.

Mantieni la conversazione privata

Se l'archivio include dati finanziari, dei clienti, dei dipendenti o operativi, la conversione dovrebbe avvenire prima di qualsiasi fase di AI cloud—e preferibilmente all'interno dello stesso ambiente controllato che ospita il resto della pipeline RAG.

I convertitori online gratuiti sono la dipendenza sbagliata per un sistema AI che rispetta la privacy. Reintroducono esattamente le questioni sulla residenza dei dati che un LLM privato è progettato per eliminare.

Consigli per l'indicizzazione che ripagano in seguito

Cattura i metadata per singolo file durante la conversione: percorso di origine, percorso di output, estensione originale, timestamp della conversione e qualsiasi progetto, anno o entità che può essere dedotto dalla struttura delle cartelle. Inserisci quei metadata nel deposito vettoriale come campi filtrabili.

Recupero di test di esempio rispetto a alcune domande storiche note prima di dichiarare l'archivio pronto per RAG. La domanda giusta spesso rivela schede o assunzioni che devono essere inserite nell'indice.

Smetti di costruire RAG su un archivio parziale

Un LLM privato è intelligente solo quanto il corpus che può vedere. Converti una volta l'archivio di fogli di calcolo legacy, indicizzalo con metadati e lascia che il modello legga finalmente ciò che l'azienda sa realmente.

Letture correlate

Rendi gli archivi legacy Microsoft Works parte del tuo corpus IA privato

Prova Microsoft Works File Converter su un archivio rappresentativo e genera output CSV, Markdown, XLSX e PDF pronti per l'inserimento nella tua pipeline RAG.

Prova gratuita

Tutte le funzioni dell’app — fino a 10 file

Windows 10 o 11

Scarica il programma di installazione offline qui sotto per la prova completa di 10 file. La conversione resta sul tuo PC.

Acquista Standard — $39.95