OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

Optimitzar les càrregues de fitxers a ChatGPT Enterprise

Entén com les funcions de ChatGPT Enterprise gestionen els fitxers segons el tipus, el nombre i la mida. Millora els resultats segons els requisits dels fitxers.

Actualització: 21 hours ago

ChatGPT Enterprise ara admet la lectura i comprensió d’elements visuals (imatges, gràfics, diagrames, etc.) incrustats en fitxers PDF inclosos en les indicacions. Els usuaris poden carregar un PDF, i ChatGPT pot interpretar el text i qualsevol element visual dins d’aquest fitxer.

Per obtenir més informació, consulta les preguntes freqüents sobre la recuperació visual amb PDF.

ChatGPT Enterprise et permet carregar fitxers de diverses maneres:

Aquesta guia explica com les funcionalitats de ChatGPT Enterprise gestionen els fitxers segons el tipus, el nombre i la mida, i analitza estratègies per millorar els resultats en funció dels requisits dels fitxers.

Resum

ChatGPT Enterprise tracta els diferents tipus de fitxer de maneres molt diferents: extreu text de documents de text com PDF, presentacions i fitxers Word, analitza dades estructurades de fulls de càlcul amb codi Python i descriu fitxers d’imatge mitjançant GPT-Vision. Entendre quin tipus de fitxer activa quin flux de treball és clau per obtenir el resultat esperat.

Per als documents basats en text, ChatGPT Enterprise inclou tant text rellevant com sigui possible directament al costat de la indicació i utilitza un sistema de cerca per accedir a informació addicional. Això funciona bé per respondre preguntes específiques. Tanmateix, aquest enfocament pot tenir dificultats amb tasques complexes, com resumir documents molt grans o comparar diversos fitxers grans. Continua llegint per entendre estratègies per millorar els resultats.

Gestió de fitxers segons el tipus

ChatGPT Enterprise processa els fitxers de tres maneres principals: extracció de text, anàlisi de codi i interpretació d’imatges. El tipus de fitxer determina quin flux de treball segueix ChatGPT Enterprise.

Recuperació basada en textIntèrpret de codiProcessament d’imatgesRecuperació visual
Exemples de tipus de fitxerpptx, docx, txt, md, json, xml, pdf*
* PDF carregats com a

coneixement de GPT
o

fitxers de projecte
csv, xls, xlsx*
*Nota: l’Intèrpret de codi pot operar amb qualsevol tipus de fitxer, però ChatGPT Enterprise normalment usa CI per defecte per als fulls de càlcul
jpg, pngpdf*
* PDF inclosos en les indicacions dels usuaris
ComportamentExtreu el text del fitxer: una part del text s’enganxa («s’insereix») directament a la finestra de context; una part del text s’emmagatzema per a la cercaL’Intèrpret de codi passa el fitxer a Python perquè el processiLes imatges són interpretades de manera nativa per models multimodals, subjectes a

limitacions conegudes
.
Un híbrid de recuperació de text i processament d’imatges. El text s’extreu digitalment, i el contingut visual és interpretat de manera nativa per models multimodals.

Per a fitxers només de text, fitxers d’imatge o fitxers de dades clarament estructurades (p. ex., una taula d’Excel de transaccions), aquestes divisions representen el millor comportament possible.

Hi ha algunes zones grises que són menys òbvies, per exemple:

  • Les imatges incrustades en fitxers que no siguin PDF no es processen. Per incloure-les, converteix el fitxer a PDF abans de carregar-lo.

  • ChatGPT Enterprise sempre utilitzarà l’Intèrpret de codi per interactuar amb fulls de càlcul, encara que el document contingui una gran quantitat de text. Per exemple, si demanes a ChatGPT Enterprise que tradueixi un fitxer CSV amb 10 files de text, intentarà traduir el fitxer amb una biblioteca de Python, cosa que és menys precisa que permetre que el model generi una traducció directament. Per mitigar-ho, prova d’exportar el full de càlcul a un format basat en text (PDF, per exemple).

  • De manera similar, si carregues una taula transaccional estructurada continguda en un fitxer JSON, ChatGPT Enterprise interpretarà aquest fitxer com a text sense format. Si vols analitzar les dades contingudes en un fitxer JSON, indica al model que utilitzi l’Intèrpret de codi a la teva indicació.

Gestió de fitxers segons la mida

ChatGPT Enterprise utilitza models amb una finestra de context màxima de 128 k segments (aproximadament 200 pàgines de text). Tanmateix, no tots els segments s’utilitzen per incorporar el text dels fitxers carregats. El nombre de segments «inserits» varia segons el tipus d’ús.

ChatGPT Enterprise «insereix» una certa quantitat de text, i el text restant s’envia a un índex de cerca privat (un «magatzem vectorial», que és un tipus de base de dades dissenyat per emmagatzemar i recuperar grans quantitats de text de manera eficient). Quan fas una pregunta, ChatGPT Enterprise incorpora el text inclòs juntament amb fragments rellevants recuperats d’un índex de cerca privat.

Si carregues un sol document, ChatGPT Enterprise inclou text des del principi fins que arriba al seu límit. Si carregues diversos documents, ChatGPT Enterprise inclou una part o la totalitat de cada document. Tot el text dels documents també s’envia a un índex de cerca privat.

Inserció de context per a documents de text

Aquesta funció està en desenvolupament actiu. Per tant, els detalls següents poden canviar sense avís previ.

ChatGPT Enterprise pot processar fins a 110 k segments de documents carregats a la finestra de context. Si carregues un o més documents amb un total combinat de menys de 110 k segments, s’inclourà tot el contingut.

Per a un sol document que superi els 110 k segments, només s’inclouran els primers 110 k segments, començant pel principi. La resta només s’enviarà a l’índex de cerca privat.

Si es carreguen diversos documents i el seu total combinat supera els 110 k segments, ChatGPT Enterprise utilitza un procés de dos passos per equilibrar la representació dels documents:

  1. Extreu fins a 55 k segments, dividits equitativament entre els documents carregats.

  1. Per als documents que no queden completament representats en el primer pas, assigna els 55 k segments restants proporcionalment segons els segments que queden a cada document.

  1. Els segments restants només s’envien a l’índex de cerca privat.

Pots estimar el nombre de segments d’un document de text copiant-ne el text a l’OpenAI Tokenizer.

Inserció de context per a PDF multimèdia

Quan els usuaris carreguen PDF que contenen tant text com imatges, la recuperació visual permet que ChatGPT processi aquestes imatges de manera nativa juntament amb el text extret digitalment. Els passos següents complementen els nostres procediments estàndard de gestió del context per a PDF multimèdia:

  • Extracció i incrustació d’imatges: Les imatges s’extreuen i s’incrusten juntament amb el seu text digital associat.

  • Escalat intel·ligent: Les imatges s’escalen automàticament per mantenir un equilibri entre la qualitat de la informació i l’ús eficient de la finestra de context disponible.

Quan els PDF carregats superen el límit de 110 k segments, tant les imatges com el text s’incrusten a l’índex de cerca privat. Les incrustacions de text fan referència a imatges rellevants, cosa que permet a ChatGPT recuperar els parells de text i imatge adequats segons les consultes dels usuaris. Les imatges recuperades es processen després mitjançant les capacitats multimodals natives de ChatGPT.

Estimar amb precisió els requisits de segments per a PDF multimèdia és difícil. Les proves suggereixen que aproximadament 350 pàgines de text i imatges barrejats utilitzaran completament la finestra de context de 110 k segments.

Estratègies de cerca segons el tipus de model

Tant els models de la sèrie GPT com els de la sèrie o admeten la càrrega de fitxers i utilitzen la mateixa lògica d’inserció de context i d’incrustacions de cerca. Tots els models executen cerques híbrides en un índex de cerca privat, combinant mètodes de paraules clau i semàntics. En una cerca híbrida, el model genera una frase de cerca basada en la indicació de l’usuari, i l’índex de cerca privat recupera el text i les imatges rellevants en conseqüència.

Tanmateix, aquests models difereixen en la manera com cerquen en documents grans que superen la finestra de context:

Models de la sèrie GPT

  • Una sola cerca per indicació: Els models de la sèrie GPT fan una cerca per cada indicació de l’usuari.

  • Casos d’ús efectius: Ideals per respondre preguntes senzilles incloses en documentació extensa.

Exemples de consultes:

  • «Quina és la política de RR. HH. sobre jubilació anticipada?»

  • «Què fa la funció process_order

Models de la sèrie o

  • Diverses cerques per indicació: Pot executar diverses cerques (normalment 2-3) per indicació de l’usuari, cadascuna amb una frase de cerca única. Les cerques s’executen de manera seqüencial, i el model pot actualitzar el seu enfocament segons la informació recuperada en cerques anteriors.

  • Casos d’ús efectius: Més adequats per a preguntes complexes que requereixen diverses cerques dirigides en documentació extensa.

Exemples de consultes:

  • «Quines són les polítiques de RR. HH. sobre jubilació anticipada, permís parental i trasllat a l’estranger?»

  • «Explica què fa la funció process_order, enumera tots els mètodes invocats per aquesta funció i descriu breument cada mètode invocat.»

Malgrat els seus punts forts, els models de la sèrie o poden tenir dificultats quan una consulta requereix més de tres cerques.

Consells per millorar els resultats de la cerca de fitxers

  • Prova d’utilitzar un model de la sèrie o per a preguntes complexes que requereixen diverses cerques.

  • Recorda que les respostes poden variar segons el tipus, el nombre i la mida dels documents que carreguis.

  • En general, carregar menys documents i més enfocats comportarà una precisió més alta.

  • Converteix els temes amb diverses preguntes en preguntes individuals:

    • Si necessites conèixer les polítiques de RR. HH. de cada estat, pregunta-les una per una.

    • Si necessites resumir molts documents, demana un document cada vegada. Si aquest document té molts centenars de pàgines, considera dividir-lo en components més petits.

      • Podries demanar a ChatGPT Enterprise que escrigui un «resum de resums» si li proporcionessis diversos resums en lloc de documents sencers.

    • Si tens un CSV d’una RFP (cada línia és una pregunta diferent), fes aquestes preguntes una per una en lloc de carregar el CSV i demanar una sola resposta.

  • Troba maneres d’auditar les respostes del model. A continuació hi ha exemples d’instruccions per a GPT:

# Context 

Ets un expert en comprendre documents. L'usuari adjuntarà un document i farà una pregunta. Ha de poder connectar la teva resposta amb la part exacta del text d'on has tret la resposta.

# Instruccions

1. Respon la pregunta de l'usuari basant-te en el document adjunt amb el format exacte que s'indica a continuació

# Format

- Pregunta: { repeteix la pregunta de l'usuari }
- Resposta: { proporciona una resposta a la pregunta de l'usuari }
Font:
- - Número de secció: { proporciona el número de secció d'on has tret la resposta }
- - Títol de la secció: { proporciona el títol de la secció d'on has tret la resposta }
- - Text exacte: { proporciona el text exacte d'on has tret la resposta }

# Regles

- Dona respostes clares i concises
- Proporciona només informació continguda al document
- Si no trobes la resposta al document, simplement respon «No s'ha trobat informació.»

T'ha estat útil aquest article?