OpenAI
Ez az oldal gépi fordítással készült. Tekintsd meg az eredeti angol nyelvű cikket.

Fájlfeltöltések optimalizálása a ChatGPT Enterprise-ban

Ismerje meg, hogyan kezelik a ChatGPT Enterprise funkciói a fájlokat típusuk, számuk és méretük alapján. Javítsa a kimeneteket a fájlkövetelmények szerint.

Frissítve: 12 days ago

A ChatGPT Enterprise mostantól támogatja az utasításokban szereplő PDF-fájlokba ágyazott vizuális elemek (képek, grafikonok, diagramok stb.) olvasását és megértését. A felhasználók feltölthetnek egy PDF-et, és a ChatGPT értelmezni tudja a fájlban található szöveget és bármilyen vizuális elemet.

Részletekért lásd: Gyakori kérdések a PDF-ekkel végzett vizuális lekérésről.

A ChatGPT Enterprise többféle módon teszi lehetővé fájlok feltöltését:

Ez az útmutató ismerteti, hogyan kezelik a ChatGPT Enterprise funkciói a fájlokat azok típusa, száma és mérete alapján, valamint bemutatja, hogyan javíthatók a kimenetek a fájlokra vonatkozó követelmények függvényében.

Összefoglalás

A ChatGPT Enterprise jelentősen eltérő módon kezeli a különböző fájltípusokat: szöveget nyer ki az olyan szöveges dokumentumokból, mint a PDF-ek, prezentációk és Word-fájlok; Python-kóddal elemzi a táblázatok strukturált adatait; a képfájlokat pedig a GPT-Vision segítségével írja le. A kívánt eredmény eléréséhez elengedhetetlen annak ismerete, hogy az egyes fájltípusok mely munkafolyamatot indítják el.

Szöveges dokumentumok esetén a ChatGPT Enterprise a lehető legtöbb releváns szöveget közvetlenül az utasítás mellett helyezi el, a további információkat pedig keresőrendszerrel éri el. Ez jól működik konkrét kérdések megválaszolásakor. Ez a megközelítés azonban nehézségekbe ütközhet olyan összetett feladatoknál, mint a nagyon nagy dokumentumok összefoglalása vagy több nagy fájl összehasonlítása. Olvasson tovább, és ismerje meg, milyen módszerekkel javíthatja az eredményeket.

Fájlok kezelése típus szerint

A ChatGPT Enterprise három fő módon dolgozza fel a fájlokat: szövegkinyeréssel, kódelemzéssel és képértelmezéssel. A fájltípus határozza meg, hogy a ChatGPT Enterprise melyik munkafolyamatot követi.

Szövegalapú visszakeresésKódértelmezőKépfeldolgozásVizuális visszakeresés
Példák fájltípusokrapptx, docx, txt, md, json, xml, pdf*
* A PDF-ek

GPT-ismeretanyagként
vagy

projektfájlként
feltöltve
csv, xls, xlsx*
*Megjegyzés: A kódértelmező bármilyen fájltípussal képes dolgozni, de táblázatok esetén a ChatGPT Enterprise alapértelmezés szerint általában a CI-t használja
jpg, pngpdf*
* Felhasználói utasításokban szereplő PDF-ek
MűködésKinyeri a szöveget a fájlból – a szöveg egy részét közvetlenül beilleszti („betölti”) a kontextusablakba, a többit pedig keresés céljából tároljaA kódértelmező feldolgozásra átadja a fájlt a PythonnakA képeket a multimodális modellek natív módon értelmezik, az

ismert korlátozások
figyelembevételével.
A szöveges visszakeresés és a képfeldolgozás hibridje. A rendszer digitálisan kinyeri a szöveget, a vizuális tartalmat pedig a multimodális modellek natív módon értelmezik.

A csak szöveget vagy képet tartalmazó fájlok, illetve az egyértelműen strukturált adatfájlok – például tranzakciókat tartalmazó Excel-táblázatok – esetében ezek a kategóriák biztosítják a lehető legjobb működést.

Vannak azonban kevésbé egyértelmű, szürke területek is, például:

  • A PDF-től eltérő fájlokba ágyazott képeket a rendszer nem dolgozza fel. Ha ezeket is fel szeretné dolgoztatni, feltöltés előtt alakítsa PDF-formátumúvá a fájlt.

  • A ChatGPT Enterprise mindig a kódértelmezőt használja a táblázatok kezeléséhez, még akkor is, ha a dokumentum nagy mennyiségű szöveget tartalmaz. Ha például arra kéri a ChatGPT Enterprise-t, hogy fordítson le egy tízsornyi szöveget tartalmazó CSV-fájlt, akkor egy Python-könyvtár segítségével próbálja lefordítani a fájlt. Ez kevésbé pontos, mint ha a modell közvetlenül készítené el a fordítást. Ennek elkerüléséhez exportálja a táblázatot valamilyen szövegalapú formátumba, például PDF-be.

  • Hasonlóképpen, ha JSON-fájlban található strukturált tranzakciós táblázatot tölt fel, a ChatGPT Enterprise egyszerű szövegként értelmezi a fájlt. Ha egy JSON-fájlban található adatokat szeretne elemezni, az utasításban kérje meg a modellt a kódértelmező használatára.

Fájlok kezelése méret alapján

A ChatGPT Enterprise legfeljebb 128k tokenes kontextusablakkal rendelkező modelleket használ (ez nagyjából 200 oldalnyi szöveg). Azonban nem minden token szolgál a feltöltött fájlok szövegének beépítésére. A „betöltött” tokenek száma a használat típusától függően változik.

A ChatGPT Enterprise bizonyos mennyiségű szöveget „betölt”, a fennmaradó szöveg pedig egy privát keresési indexbe kerül (egy „vektortárba”, amely nagy mennyiségű szöveg hatékony tárolására és lekérésére tervezett adatbázistípus). Amikor kérdést teszel fel, a ChatGPT Enterprise a beillesztett szöveget a privát keresési indexből lekért releváns részekkel együtt használja fel.

Ha egyetlen dokumentumot töltesz fel, a ChatGPT Enterprise a dokumentum elejétől kezdve addig illeszt be szöveget, amíg el nem éri a korlátját. Ha több dokumentumot töltesz fel, a ChatGPT Enterprise mindegyik dokumentum egy részét vagy egészét beilleszti. A dokumentumok teljes szövege egy privát keresési indexbe is bekerül.

Kontextusfeltöltés szöveges dokumentumokhoz

Ez a funkció aktív fejlesztés alatt áll. Ennek megfelelően az alábbi részletek előzetes értesítés nélkül változhatnak.

A ChatGPT Enterprise akár 110k tokent is képes feldolgozni a feltöltött dokumentumokból a kontextusablakban. Ha egy vagy több olyan dokumentumot töltesz fel, amelyek összesen kevesebb mint 110k tokent tartalmaznak, a teljes tartalom bekerül.

Egy 110k tokent meghaladó dokumentum esetén csak az első 110k token kerül be, a dokumentum elejétől kezdve. A fennmaradó rész csak a privát keresési indexbe kerül.

Ha több dokumentumot töltesz fel, és ezek együttesen meghaladják a 110k tokent, a ChatGPT Enterprise kétlépéses folyamatot használ a dokumentumok kiegyensúlyozott képviseletéhez:

  1. Legfeljebb 55k token kinyerése, egyenlően elosztva a feltöltött dokumentumok között.

  1. Azoknál a dokumentumoknál, amelyek az első lépésben nem jelennek meg teljes egészükben, a fennmaradó 55k tokent arányosan osztja el az egyes dokumentumokban maradt tokenek alapján.

  1. A megmaradó tokenek csak a privát keresési indexbe kerülnek.

Egy szöveges dokumentumban található tokenek számát úgy becsülheted meg, hogy a dokumentum szövegét bemásolod az OpenAI Tokenizer eszközbe.

Kontextusfeltöltés multimédiás PDF-ekhez

Amikor a felhasználók szöveget és képeket egyaránt tartalmazó PDF-eket töltenek fel, a vizuális lekérés lehetővé teszi, hogy a ChatGPT ezeket a képeket natívan, a digitálisan kinyert szöveggel együtt dolgozza fel. Az alábbi lépések kiegészítik a multimédiás PDF-ekre vonatkozó szabványos kontextuskezelési eljárásainkat:

  • Képkivonás és beágyazás: A képek a hozzájuk kapcsolódó digitális szöveggel együtt kerülnek kinyerésre és beágyazásra.

  • Intelligens méretezés: A képek automatikusan méreteződnek, hogy egyensúlyban maradjon az információ minősége és a rendelkezésre álló kontextusablak hatékony használata.

Ha a feltöltött PDF-ek meghaladják a 110k tokenes korlátot, a képek és a szöveg egyaránt beágyazásra kerülnek a privát keresési indexbe. A szövegbeágyazások releváns képekre hivatkoznak, így a ChatGPT a felhasználói lekérdezések alapján le tudja kérni a megfelelő szöveg–kép párokat. A lekért képeket ezután a ChatGPT natív multimodális képességei dolgozzák fel.

A multimédiás PDF-ek tokenigényének pontos becslése kihívást jelent. A tesztek alapján körülbelül 350 oldalnyi vegyes szöveg és kép teljesen kihasználja a 110k tokenes kontextusablakot.

Keresési stratégiák modelltípus alapján

A GPT-sorozatú és az o-sorozatú modellek egyaránt támogatják a fájlfeltöltést, és azonos kontextusfeltöltési és keresési beágyazási logikát használnak. Minden modell hibrid kereséseket hajt végre egy privát keresési indexen, kulcsszavas és szemantikus módszereket kombinálva. Hibrid keresés esetén a modell a felhasználó utasítása alapján keresési kifejezést generál, a privát keresési index pedig ennek megfelelően lekéri a releváns szövegeket és képeket.

Ezek a modellek azonban eltérnek abban, hogyan keresnek a kontextusablakot meghaladó nagy dokumentumokban:

GPT-sorozatú modellek

  • Egy keresés utasításonként: A GPT-sorozatú modellek felhasználói utasításonként egy keresést végeznek.

  • Hatékony felhasználási módok: Ideális a kiterjedt dokumentációban szereplő egyszerű kérdések megválaszolásához.

Példák lekérdezésekre:

  • „Milyen HR-szabályzat vonatkozik a korai nyugdíjazásra?”

  • „Mit csinál a process_order függvény?”

o-sorozatú modellek

  • Több keresés utasításonként: Felhasználói utasításonként több, jellemzően 2–3 keresést is képes végrehajtani, mindegyiket egyedi keresőkifejezéssel. A keresések egymás után futnak le, a modell pedig a korábbi keresések során talált információk alapján módosíthatja a megközelítését.

  • Hatékony felhasználási módok: Alkalmasabb olyan összetett kérdésekhez, amelyek kiterjedt dokumentációban végzett, több célzott keresést igényelnek.

Példák lekérdezésekre:

  • „Milyen HR-szabályzatok vonatkoznak a korai nyugdíjazásra, a szülői szabadságra és a külföldi áthelyezésre?”

  • „Ismertesse, mit csinál a process_order függvény, sorolja fel az általa meghívott összes metódust, és röviden mutassa be mindegyiket.”

Erősségeik ellenére az o-sorozatú modellek nehézségekbe ütközhetnek, ha egy lekérdezés háromnál több keresést igényel.

Tippek a fájlkeresési eredmények javításához

  • Összetett, több keresést igénylő kérdésekhez próbálj meg o-sorozatú modellt használni.

  • Ne feledd, hogy a válaszok a feltöltött dokumentumok típusától, számától és méretétől függően eltérhetnek.

  • Általában kevesebb, célzott dokumentum betöltése nagyobb pontosságot eredményez.

  • Alakítsd az összetett, több kérdésből álló témákat egyedi kérdésekké:

    • Ha minden állam HR-irányelveire szükséged van, kérdezd le őket egyenként.

    • Ha sok dokumentumot kell összefoglalnod, egyszerre egy dokumentumról kérj összefoglalót. Ha az adott dokumentum sok száz oldalas, érdemes kisebb részekre bontani.

      • Megkérheted a ChatGPT Enterprise-t, hogy írjon „összefoglalók összefoglalóját”, ha teljes dokumentumok helyett több összefoglalót adtál meg neki.

    • Ha egy RFP-t tartalmazó CSV-d van (ahol minden sor más-más kérdés), ahelyett, hogy csak betöltenéd a CSV-t és egyetlen választ kérnél, tedd fel ezeket a kérdéseket egyenként.

  • Keress módszereket a modell válaszainak ellenőrzésére. Az alábbiakban példa GPT-utasítások találhatók:

# Kontextus 

Szakértője a dokumentumok megértésének. A felhasználó csatolni fog egy dokumentumot, és feltesz egy kérdést. Képesnek kell lennie arra, hogy a válaszát visszakösse a szöveg pontos részéhez, ahonnan a választ vette.

# Utasítások

1. Válaszolja meg a felhasználó kérdését a csatolt dokumentum alapján az alább megadott pontos formátumban

# Formátum

- Kérdés: { ismételje meg a felhasználó kérdését }
- Válasz: { adjon választ a felhasználó kérdésére }
Forrás:
- - Szakasz száma: { adja meg annak a szakasznak a számát, ahonnan a választ vette }
- - Szakasz címe: { adja meg annak a szakasznak a címét, ahonnan a választ vette }
- - Pontos szöveg: { adja meg a pontos szöveget, ahonnan a választ vette }

# Szabályok

- Adjon világos és tömör válaszokat
- Csak a dokumentumban szereplő információkat adja meg
- Ha nem találja a választ a dokumentumban, egyszerűen ezt válaszolja: „Nem található információ.”

Hasznos volt ez a cikk?