OpenAI
Deze pagina is automatisch vertaald. Bekijk het oorspronkelijke Engelstalige artikel.

Bestanden uploaden optimaliseren in ChatGPT Enterprise

Begrijp hoe functies in ChatGPT Enterprise bestanden verwerken op basis van type, aantal en grootte. Verbeter output op basis van bestandsvereisten.

Bijgewerkt: 10 days ago

ChatGPT Enterprise ondersteunt nu het lezen en begrijpen van visuele elementen (afbeeldingen, grafieken, diagrammen, enz.) die zijn ingesloten in PDF-bestanden die in prompts zijn opgenomen. Gebruikers kunnen een PDF uploaden, en ChatGPT kan de tekst en eventuele visuele elementen in dat bestand interpreteren.

Zie voor details Veelgestelde vragen over Visual Retrieval met PDF’s.

Met ChatGPT Enterprise kunt u op verschillende manieren bestanden uploaden:

In deze handleiding leest u hoe functies van ChatGPT Enterprise bestanden verwerken op basis van het type, aantal en formaat, en welke strategieën u kunt gebruiken om de uitvoer te verbeteren op basis van de bestandsvereisten.

Samenvatting

ChatGPT Enterprise verwerkt verschillende bestandstypen op sterk uiteenlopende manieren: het extraheert tekst uit tekstdocumenten zoals pdf's, presentaties en Word-bestanden, analyseert gestructureerde gegevens uit spreadsheets met Python-code en beschrijft afbeeldingsbestanden met GPT-Vision. Om het verwachte resultaat te krijgen, is het essentieel om te weten welk bestandstype welke workflow activeert.

Bij tekstdocumenten neemt ChatGPT Enterprise zo veel mogelijk relevante tekst rechtstreeks naast de prompt op en gebruikt het een zoeksysteem om aanvullende informatie te raadplegen. Dit werkt goed voor het beantwoorden van specifieke vragen. Deze aanpak kan echter moeite hebben met complexe taken, zoals het samenvatten van zeer grote documenten of het vergelijken van meerdere grote bestanden. Lees verder voor strategieën waarmee u uw resultaten kunt verbeteren.

Bestanden verwerken op basis van het type

ChatGPT Enterprise verwerkt bestanden op drie manieren: tekstextractie, codeanalyse en beeldinterpretatie. Het bestandstype bepaalt welke workflow ChatGPT Enterprise volgt.

Tekstgebaseerd ophalenCode-interpreterBeeldverwerkingVisueel ophalen
Voorbeelden van bestandstypenpptx, docx, txt, md, json, xml, pdf*
* Pdf's die zijn geüpload als

GPT-kennis
of

projectbestanden
csv, xls, xlsx*
*Opmerking: Code-interpreter kan elk bestandstype verwerken, maar bij spreadsheets kiest ChatGPT Enterprise doorgaans standaard voor CI
jpg, pngpdf*
* Pdf's die in gebruikersprompts zijn opgenomen
WerkingExtraheert de tekst uit het bestand: een deel van de tekst wordt rechtstreeks in het contextvenster geplakt ("ingevoegd") en een ander deel wordt opgeslagen voor zoekopdrachtenCode-interpreter geeft het bestand door aan Python voor verwerkingAfbeeldingen worden rechtstreeks geïnterpreteerd door multimodale modellen, met inachtneming van

bekende beperkingen
.
Een combinatie van tekst ophalen en beeldverwerking. Tekst wordt digitaal geëxtraheerd en visuele inhoud wordt rechtstreeks geïnterpreteerd door multimodale modellen.

Voor bestanden met alleen tekst, afbeeldingsbestanden of duidelijk gestructureerde gegevensbestanden (bijvoorbeeld een Excel-tabel met transacties) bieden deze categorieën de best mogelijke verwerking.

Er zijn enkele minder duidelijke grensgevallen, bijvoorbeeld:

  • Afbeeldingen die zijn ingesloten in andere bestanden dan pdf's, worden niet verwerkt. Wilt u deze wel opnemen, converteer het bestand dan vóór het uploaden naar pdf.

  • ChatGPT Enterprise gebruikt altijd Code-interpreter voor spreadsheets, zelfs als het document veel tekst bevat. Als u ChatGPT Enterprise bijvoorbeeld vraagt een CSV-bestand met tien rijen tekst te vertalen, probeert het systeem dit bestand te vertalen met een Python-bibliotheek. Dat is minder nauwkeurig dan wanneer het model de vertaling rechtstreeks genereert. U kunt dit probleem beperken door de spreadsheet naar een tekstgebaseerde indeling te exporteren, bijvoorbeeld pdf.

  • Als u een gestructureerde transactietabel in een JSON-bestand uploadt, interpreteert ChatGPT Enterprise dit bestand eveneens als platte tekst. Wilt u de gegevens in een JSON-bestand analyseren, geef het model dan in uw prompt de opdracht om Code-interpreter te gebruiken.

Bestanden verwerken op basis van grootte

ChatGPT Enterprise gebruikt modellen met een maximaal contextvenster van 128k tokens (ongeveer 200 pagina’s tekst). Niet alle tokens worden echter gebruikt om de tekst uit geüploade bestanden op te nemen. Het aantal “ingevoegde” tokens verschilt per gebruikstype.

ChatGPT Enterprise “voegt” een bepaalde hoeveelheid tekst in, en de resterende tekst wordt naar een privézoekindex gestuurd (een “vector store”, een type database dat is ontworpen om grote hoeveelheden tekst efficiënt op te slaan en op te halen). Wanneer je een vraag stelt, haalt ChatGPT Enterprise de opgenomen tekst erbij, samen met relevante fragmenten die uit een privézoekindex zijn opgehaald.

Als je één document uploadt, neemt ChatGPT Enterprise tekst vanaf het begin op totdat de limiet is bereikt. Als je meerdere documenten uploadt, neemt ChatGPT Enterprise een deel of alles van elk document op. Alle tekst uit de documenten wordt ook naar een privézoekindex gestuurd.

Contextvulling voor tekstdocumenten

Deze functie is actief in ontwikkeling. Daarom kunnen de volgende details zonder voorafgaande kennisgeving worden gewijzigd.

ChatGPT Enterprise kan tot 110k tokens uit geüploade documenten in het contextvenster verwerken. Als je één of meer documenten uploadt met samen minder dan 110k tokens, wordt de volledige inhoud opgenomen.

Voor één document met meer dan 110k tokens worden alleen de eerste 110k tokens opgenomen, vanaf het begin. De rest wordt alleen naar de privézoekindex gestuurd.

Als meerdere documenten worden geüpload en hun gezamenlijke totaal meer dan 110k tokens is, gebruikt ChatGPT Enterprise een proces in twee stappen om de documentrepresentatie in balans te brengen:

  1. Extraheer maximaal 55k tokens, gelijkmatig verdeeld over de geüploade documenten.

  1. Voor documenten die in de eerste stap niet volledig zijn vertegenwoordigd, worden de resterende 55k tokens proportioneel toegewezen op basis van de tokens die in elk document overblijven.

  1. Alle resterende tokens worden alleen naar de privézoekindex gestuurd.

Je kunt het aantal tokens in een tekstdocument schatten door de tekst van het document naar de OpenAI Tokenizer te kopiëren.

Contextvulling voor multimedia-pdf’s

Wanneer gebruikers pdf’s uploaden die zowel tekst als afbeeldingen bevatten, stelt Visual Retrieval ChatGPT in staat deze afbeeldingen native te verwerken naast digitaal geëxtraheerde tekst. De volgende stappen vullen onze standaardprocedures voor contextverwerking voor multimedia-pdf’s aan:

  • Afbeeldingsextractie en embedding: Afbeeldingen worden geëxtraheerd en ingebed samen met de bijbehorende digitale tekst.

  • Intelligente schaalvergroting: Afbeeldingen worden automatisch geschaald om een balans te behouden tussen informatiekwaliteit en efficiënt gebruik van het beschikbare contextvenster.

Wanneer geüploade pdf’s de limiet van 110k tokens overschrijden, worden zowel afbeeldingen als tekst ingebed in de privézoekindex. Tekst-embeddings verwijzen naar relevante afbeeldingen, waardoor ChatGPT de juiste tekst-afbeeldingsparen kan ophalen op basis van gebruikersquery’s. Opgehaalde afbeeldingen worden vervolgens verwerkt met de native multimodale mogelijkheden van ChatGPT.

Het nauwkeurig inschatten van tokenvereisten voor multimedia-pdf’s is lastig. Tests suggereren dat ongeveer 350 pagina’s met gemengde tekst en afbeeldingen het contextvenster van 110k tokens volledig zullen benutten.

Zoekstrategieën op basis van modeltype

Zowel GPT-serie modellen als o-serie modellen ondersteunen bestandsuploads en gebruiken identieke logica voor contextvulling en zoek-embeddings. Alle modellen voeren hybride zoekopdrachten uit op een privézoekindex, waarbij trefwoord- en semantische methoden worden gecombineerd. Bij een hybride zoekopdracht genereert het model een zoekterm op basis van de prompt van de gebruiker, waarna de privézoekindex relevante tekst en afbeeldingen ophaalt.

Deze modellen verschillen echter in hoe ze zoeken in grote documenten die het contextvenster overschrijden:

modellen uit de GPT-serie

  • Eén zoekopdracht per prompt: Modellen uit de GPT-serie voeren per gebruikersprompt één zoekopdracht uit.

  • Geschikte toepassingen: Ideaal voor het beantwoorden van eenvoudige vragen waarvan het antwoord in uitgebreide documentatie staat.

Voorbeeldvragen:

  • "Wat is het HR-beleid voor vervroegd pensioen?"

  • "Wat doet de functie process_order?"

modellen uit de o-serie

  • Meerdere zoekopdrachten per prompt: Kan per gebruikersprompt meerdere zoekopdrachten uitvoeren (doorgaans 2 à 3), elk met een unieke zoekterm. Zoekopdrachten worden achtereenvolgens uitgevoerd en het model kan zijn aanpak aanpassen op basis van informatie uit eerdere zoekopdrachten.

  • Geschikte toepassingen: Beter geschikt voor complexe vragen waarvoor meerdere gerichte zoekopdrachten in uitgebreide documentatie nodig zijn.

Voorbeeldvragen:

  • "Wat is het HR-beleid voor vervroegd pensioen, ouderschapsverlof en overplaatsing naar het buitenland?"

  • "Leg uit wat de functie process_order doet, noem alle methoden die deze functie aanroept en beschrijf elke aangeroepen methode kort."

Ondanks hun sterke punten kunnen modellen uit de o-serie moeite hebben met vragen waarvoor meer dan drie zoekopdrachten nodig zijn.

Tips om zoekresultaten voor bestanden te verbeteren

  • Probeer een o-serie model te gebruiken voor complexe vragen waarvoor meerdere zoekopdrachten nodig zijn.

  • Onthoud dat antwoorden kunnen variëren afhankelijk van het type, het aantal en de grootte van de documenten die je uploadt.

  • Over het algemeen leidt het laden van minder, gerichte documenten tot hogere nauwkeurigheid.

  • Zet onderwerpen met meerdere vragen om in losse vragen:

    • Als je het HR-beleid van elke staat moet kennen, stel de vragen dan één voor één.

    • Als je veel documenten moet samenvatten, vraag dan om één document tegelijk. Als dat document vele honderden pagina’s telt, overweeg dan het in kleinere onderdelen op te splitsen.

      • Je zou ChatGPT Enterprise kunnen vragen een “samenvatting van samenvattingen” te schrijven als je het meerdere samenvattingen geeft in plaats van volledige documenten.

    • Als je een CSV van een RFP hebt (elke regel is een andere vraag), stel die vragen dan één voor één in plaats van alleen de CSV te laden en om één antwoord te vragen.

  • Zoek manieren om de antwoorden van het model te controleren. Voorbeeldinstructies voor GPT staan hieronder:

# Context 

Je bent een expert in het begrijpen van documenten. De gebruiker gaat een document toevoegen en een vraag stellen. Ze moeten jouw antwoord kunnen herleiden tot het exacte deel van de tekst waaruit je je antwoord hebt gehaald.

# Instructies

1. Beantwoord de vraag van de gebruiker op basis van het bijgevoegde document en gebruik exact de onderstaande indeling

# Indeling

- Vraag: { herhaal de vraag van de gebruiker }
- Antwoord: { geef een antwoord op de vraag van de gebruiker }
Bron:
- - Sectienummer: { geef het sectienummer waaruit je het antwoord hebt gehaald }
- - Sectietitel: { geef de sectietitel waaruit je het antwoord hebt gehaald }
- - Exacte tekst: { geef de exacte tekst waaruit je het antwoord hebt gehaald }

# Regels

- Geef antwoorden die duidelijk en beknopt zijn
- Geef alleen informatie die in het document staat
- Als je het antwoord niet in het document kunt vinden, antwoord dan simpelweg “Geen informatie gevonden.”

Was dit artikel nuttig?