ChatGPT Enterprise ora supporta la lettura e la comprensione di elementi visivi (immagini, grafici, diagrammi, ecc.) incorporati nei file PDF inclusi nei prompt. Gli utenti possono caricare un PDF e ChatGPT può interpretare il testo e qualsiasi elemento visivo all'interno del file.
Per i dettagli, consulta le FAQ su Visual Retrieval con i PDF.
ChatGPT Enterprise consente di caricare file in diversi modi:
Direttamente dal computer
Come conoscenza dei GPT
Come file di progetto
Da un'azione GPT
Questa guida spiega come le funzionalità di ChatGPT Enterprise gestiscono i file in base al tipo, al numero e alle dimensioni, e illustra le strategie per migliorare i risultati in funzione dei requisiti dei file.
Riepilogo
ChatGPT Enterprise gestisce i diversi tipi di file in modi molto diversi: estrae il testo da documenti quali PDF, presentazioni e file Word, analizza con codice Python i dati strutturati dei fogli di calcolo e descrive i file di immagine tramite GPT-Vision. Capire quale flusso di lavoro viene attivato da ciascun tipo di file è fondamentale per ottenere il risultato previsto.
Per i documenti testuali, ChatGPT Enterprise inserisce direttamente accanto al prompt quanto più testo pertinente possibile e usa un sistema di ricerca per accedere a informazioni aggiuntive. Questo metodo è efficace per rispondere a domande specifiche. Tuttavia, può incontrare difficoltà con attività complesse, come riassumere documenti molto estesi o confrontare più file di grandi dimensioni. Continua a leggere per scoprire le strategie con cui migliorare i risultati.
Gestione dei file in base al tipo
ChatGPT Enterprise elabora i file principalmente in tre modi: estrazione del testo, analisi tramite codice e interpretazione delle immagini. Il tipo di file determina il flusso di lavoro seguito da ChatGPT Enterprise.
| Recupero basato sul testo | Code Interpreter | Elaborazione delle immagini | Recupero visivo | |
|---|---|---|---|---|
| Esempi di tipi di file | pptx, docx, txt, md, json, xml, pdf* * PDF caricati come conoscenza dei GPT o file di progetto | csv, xls, xlsx* *Nota: Code Interpreter può operare su qualsiasi tipo di file, ma per i fogli di calcolo ChatGPT Enterprise usa in genere CI per impostazione predefinita | jpg, png | pdf* * PDF inclusi nei prompt degli utenti |
| Comportamento | Estrae il testo dal file: una parte viene inserita direttamente nella finestra di contesto, mentre un'altra viene archiviata per la ricerca | Code Interpreter passa il file a Python per l'elaborazione | Le immagini vengono interpretate direttamente dai modelli multimodali, nel rispetto delle limitazioni note . | Un approccio ibrido che combina il recupero del testo e l'elaborazione delle immagini. Il testo viene estratto digitalmente, mentre i contenuti visivi vengono interpretati direttamente dai modelli multimodali. |
Per i file di solo testo, i file di immagine o i file con dati chiaramente strutturati, ad esempio una tabella Excel di transazioni, queste suddivisioni rappresentano il comportamento migliore possibile.
Esistono tuttavia alcuni casi meno chiari, ad esempio:
Le immagini incorporate in file diversi dai PDF non vengono elaborate. Per includerle, converti il file in PDF prima di caricarlo.
ChatGPT Enterprise usa sempre Code Interpreter per interagire con i fogli di calcolo, anche se il documento contiene una grande quantità di testo. Ad esempio, se chiedi a ChatGPT Enterprise di tradurre un file CSV con 10 righe di testo, tenterà di tradurlo usando una libreria Python, che è meno precisa rispetto a una traduzione generata direttamente dal modello. Per ovviare al problema, prova a esportare il foglio di calcolo in un formato testuale, ad esempio PDF.
Analogamente, se carichi una tabella strutturata di transazioni contenuta in un file JSON, ChatGPT Enterprise interpreterà il file come testo normale. Se vuoi analizzare i dati contenuti in un file JSON, indica al modello nel prompt di usare Code Interpreter.
Gestione dei file in base alle dimensioni
ChatGPT Enterprise usa modelli con una finestra di contesto massima di 128k token (circa 200 pagine di testo). Tuttavia, non tutti i token vengono usati per incorporare il testo dei file caricati. Il numero di token “inseriti” varia in base al tipo di utilizzo.
ChatGPT Enterprise “inserisce” una certa quantità di testo e il testo rimanente viene inviato a un indice di ricerca privato (un “vector store”, ovvero un tipo di database progettato per archiviare e recuperare in modo efficiente grandi quantità di testo). Quando poni una domanda, ChatGPT Enterprise include il testo inserito insieme ai blocchi pertinenti recuperati da un indice di ricerca privato.
Se carichi un singolo documento, ChatGPT Enterprise include il testo a partire dall'inizio fino al raggiungimento del limite. Se carichi più documenti, ChatGPT Enterprise include una parte o la totalità di ciascun documento. Tutto il testo dei documenti viene inviato anche a un indice di ricerca privato.
Inserimento del contesto per documenti di testo
Questa funzionalità è in fase di sviluppo attivo. Pertanto, i dettagli seguenti sono soggetti a modifiche senza preavviso.
ChatGPT Enterprise può elaborare fino a 110k token dai documenti caricati nella finestra di contesto. Se carichi uno o più documenti con un totale combinato inferiore a 110k token, verrà incluso l'intero contenuto.
Per un singolo documento che supera 110k token, verranno inclusi solo i primi 110k token, a partire dall'inizio. Il resto verrà inviato solo all'indice di ricerca privato.
Se vengono caricati più documenti e il loro totale combinato supera 110k token, ChatGPT Enterprise usa un processo in due passaggi per bilanciare la rappresentazione dei documenti:
Estrai fino a 55k token, suddivisi equamente tra i documenti caricati.
Per i documenti non rappresentati completamente nel primo passaggio, assegna i restanti 55k token proporzionalmente in base ai token rimasti in ciascun documento.
Eventuali token rimanenti vengono inviati solo all'indice di ricerca privato.
Puoi stimare il numero di token in un documento di testo copiando il testo del documento in OpenAI Tokenizer.
Inserimento del contesto per PDF multimediali
Quando gli utenti caricano PDF contenenti sia testo sia immagini, Visual Retrieval consente a ChatGPT di elaborare queste immagini in modo nativo insieme al testo estratto digitalmente. I passaggi seguenti integrano le nostre procedure standard di gestione del contesto per i PDF multimediali:
Estrazione ed embedding delle immagini: le immagini vengono estratte e sottoposte a embedding insieme al testo digitale associato.
Ridimensionamento intelligente: le immagini vengono ridimensionate automaticamente per mantenere un equilibrio tra qualità delle informazioni e uso efficiente della finestra di contesto disponibile.
Quando i PDF caricati superano il limite di 110k token, sia le immagini sia il testo vengono sottoposti a embedding nell'indice di ricerca privato. Gli embedding del testo fanno riferimento alle immagini pertinenti, consentendo a ChatGPT di recuperare le coppie testo-immagine appropriate in base alle query degli utenti. Le immagini recuperate vengono quindi elaborate usando le capacità multimodali native di ChatGPT.
Stimare con precisione i requisiti di token per i PDF multimediali è difficile. I test suggeriscono che circa 350 pagine con testo e immagini misti utilizzeranno completamente la finestra di contesto da 110k token.
Strategie di ricerca in base al tipo di modello
Sia i modelli della serie GPT sia quelli della serie o supportano i caricamenti di file e utilizzano la stessa logica di inserimento del contesto e di embedding di ricerca. Tutti i modelli eseguono ricerche ibride su un indice di ricerca privato, combinando metodi basati su parole chiave e semantici. In una ricerca ibrida, il modello genera una frase di ricerca in base al prompt dell'utente e l'indice di ricerca privato recupera di conseguenza testo e immagini pertinenti.
Tuttavia, questi modelli differiscono nel modo in cui cercano all'interno di documenti di grandi dimensioni che superano la finestra di contesto:
Modelli della serie GPT
Una sola ricerca per prompt: i modelli della serie GPT eseguono una ricerca per ogni prompt dell'utente.
Casi d'uso ideali: perfetti per rispondere a domande semplici le cui risposte si trovano all'interno di una documentazione estesa.
Esempi di query:
«Qual è la politica delle risorse umane in materia di pensionamento anticipato?»
«Cosa fa la funzione process_order?»
Modelli della serie o
Più ricerche per prompt: possono eseguire più ricerche (in genere 2-3) per ogni prompt dell'utente, ciascuna con una frase di ricerca specifica. Le ricerche vengono eseguite in sequenza e il modello può adattare il proprio approccio in base alle informazioni recuperate nelle ricerche precedenti.
Casi d'uso ideali: più adatti a domande complesse che richiedono più ricerche mirate all'interno di una documentazione estesa.
Esempi di query:
«Quali sono le politiche delle risorse umane in materia di pensionamento anticipato, congedo parentale e trasferimento all'estero?»
«Spiega cosa fa la funzione process_order, elenca tutti i metodi che richiama e descrivi brevemente ciascuno di essi.»
Nonostante i loro punti di forza, i modelli della serie o possono incontrare difficoltà quando una query richiede più di tre ricerche.
Suggerimenti per migliorare i risultati della ricerca nei file
Prova a usare un modello della serie o per domande complesse che richiedono più ricerche.
Ricorda che le risposte possono variare a seconda del tipo, del numero e delle dimensioni dei documenti che carichi.
In generale, caricare meno documenti e più mirati porterà a una maggiore accuratezza.
Trasforma gli argomenti con più domande in domande singole:
Se devi conoscere le policy HR di ogni stato, chiedile una alla volta.
Se devi riassumere molti documenti, chiedi un documento alla volta. Se quel documento è lungo molte centinaia di pagine, valuta di suddividerlo in componenti più piccoli.
Potresti chiedere a ChatGPT Enterprise di scrivere un “riassunto dei riassunti” se gli fornisci più riassunti anziché interi documenti.
Se hai un CSV di una RFP (ogni riga è una domanda diversa), poni quelle domande una alla volta invece di caricare semplicemente il CSV e richiedere un'unica risposta.
Trova modi per verificare le risposte del modello. Di seguito sono riportate istruzioni GPT di esempio:
# Contesto
Sei un esperto nella comprensione dei documenti. L'utente allegherà un documento e farà una domanda. Deve poter collegare la tua risposta alla parte esatta del testo da cui hai ricavato la risposta.
# Istruzioni
1. Rispondi alla domanda dell'utente in base al documento allegato usando il formato esatto fornito di seguito
# Formato
- Domanda: { repeat user's question }
- Risposta: { provide an answer to user's question }
Fonte:
- - Numero sezione: { provide section number where you pulled in the answer }
- - Titolo sezione: { provide section title where you pulled in the answer }
- - Testo esatto: { provide the exact text where you pulled the answer from }
# Regole
- Fornisci risposte chiare e concise
- Fornisci solo informazioni presenti nel documento
- Se non riesci a trovare la risposta nel documento, rispondi semplicemente "Nessuna informazione trovata."