OpenAI
See leht on masintõlgitud. Vaadake algset ingliskeelset artiklit.

Failide üleslaadimise optimeerimine ChatGPT Enterprise’is

Saate aru, kuidas ChatGPT Enterprise’i funktsioonid käsitlevad faile nende tüübi, arvu ja suuruse järgi. Parandage väljundeid vastavalt failinõuetele.

Värskendatud: 18 days ago

ChatGPT Enterprise toetab nüüd viipadesse lisatud PDF-failidesse manustatud visuaalide (pildid, graafikud, diagrammid jne) lugemist ja mõistmist. Kasutajad saavad PDF-i üles laadida ning ChatGPT saab tõlgendada selle faili teksti ja kõiki visuaalseid elemente.

Üksikasju vt PDF-idega visuaalse otsingu KKK-st.

ChatGPT Enterprise võimaldab faile üles laadida mitmel viisil:

Selles juhendis selgitatakse, kuidas ChatGPT Enterprise’i funktsioonid töötlevad faile nende tüübi, arvu ja suuruse põhjal, ning käsitletakse võimalusi failidega seotud vajaduste korral väljundite täiustamiseks.

Kokkuvõte

ChatGPT Enterprise töötleb eri tüüpi faile väga erinevalt: PDF-idest, esitlustest, Wordi failidest ja muudest tekstidokumentidest eraldatakse tekst, arvutustabelite struktureeritud andmeid analüüsitakse Pythoni koodiga ning pildifaile kirjeldatakse GPT-Visioni abil. Oodatud tulemuse saamiseks on oluline mõista, milline failitüüp millise töövoo käivitab.

Tekstipõhiste dokumentide korral lisab ChatGPT Enterprise võimalikult palju asjakohast teksti otse viiba juurde ning kasutab lisateabele juurdepääsuks otsingusüsteemi. See sobib hästi konkreetsetele küsimustele vastamiseks. Keerukate ülesannete puhul, näiteks väga mahukate dokumentide kokkuvõtmisel või mitme suure faili võrdlemisel, võib selle lähenemisega siiski raskusi tekkida. Lugege edasi, et tutvuda tulemuste parandamise võimalustega.

Failide töötlemine tüübi järgi

ChatGPT Enterprise töötleb faile peamiselt kolmel viisil: teksti eraldamise, koodianalüüsi ja piltide tõlgendamise teel. ChatGPT Enterprise’i kasutatava töövoo määrab failitüüp.

Tekstipõhine teabeotsingKoodi tõlgendajaPilditöötlusVisuaalne teabeotsing
Failitüüpide näitedpptx, docx, txt, md, json, xml, pdf*
* PDF-id, mis on üles laaditud

GPT teadmistena
või

projektifailidena
csv, xls, xlsx*
*Märkus. Koodi tõlgendaja saab töödelda mis tahes tüüpi faile, kuid arvutustabelite puhul kasutab ChatGPT Enterprise vaikimisi enamasti CI-d.
jpg, pngpdf*
* Kasutaja viipadesse lisatud PDF-id
KäitumineEraldab failist teksti – osa tekstist kleebitakse („lisatakse“) otse kontekstivaatesse ja osa talletatakse otsingu jaoks.Koodi tõlgendaja edastab faili töötlemiseks Pythonile.Multimodaalsed mudelid tõlgendavad pilte otse, arvestades

teadaolevaid piiranguid
.
Tekstipõhise teabeotsingu ja pilditöötluse kombinatsioon. Tekst eraldatakse digitaalselt ja multimodaalsed mudelid tõlgendavad visuaalset sisu otse.

Ainult teksti sisaldavate failide, pildifailide või selgelt struktureeritud andmefailide (nt tehingute Exceli tabeli) puhul tagab selline jaotus parima võimaliku toimimise.

Esineb ka vähem ilmseid piiripealseid olukordi, näiteks:

  • Muudesse failidesse kui PDF-id manustatud pilte ei töödelda. Nende kaasamiseks teisendage fail enne üleslaadimist PDF-iks.

  • ChatGPT Enterprise kasutab arvutustabelitega töötamiseks alati Koodi tõlgendajat, isegi kui dokument sisaldab palju teksti. Kui palute ChatGPT Enterprise’il näiteks tõlkida kümmet tekstirida sisaldava CSV-faili, proovib see faili tõlkida Pythoni teegi abil. See on vähem täpne kui lasta mudelil tõlge otse genereerida. Selle vältimiseks proovige eksportida arvutustabel tekstipõhisesse vormingusse, näiteks PDF-iks.

  • Samamoodi tõlgendab ChatGPT Enterprise lihttekstina JSON-faili, mis sisaldab struktureeritud tehingutabelit. Kui soovite analüüsida JSON-failis sisalduvaid andmeid, andke mudelile viibas korraldus kasutada Koodi tõlgendajat.

Failide käsitlemine suuruse põhjal

ChatGPT Enterprise kasutab mudeleid, mille maksimaalne kontekstivaade on 128k tokenit (umbes 200 lehekülge teksti). Kõiki tokeneid ei kasutata siiski üleslaaditud failide teksti kaasamiseks. „Lisatud” tokenite arv varieerub kasutustüübi järgi.

ChatGPT Enterprise „lisab” teatud hulga teksti ja ülejäänud tekst saadetakse privaatsesse otsinguindeksisse („vektorhoidlasse”, mis on andmebaasi tüüp, mis on mõeldud suurte tekstikoguste tõhusaks salvestamiseks ja hankimiseks). Kui esitad küsimuse, toob ChatGPT Enterprise kaasatud teksti koos privaatsest otsinguindeksist hangitud asjakohaste lõikudega.

Kui laadid üles ühe dokumendi, kaasab ChatGPT Enterprise teksti algusest alates kuni oma piiranguni. Kui laadid üles mitu dokumenti, kaasab ChatGPT Enterprise igast dokumendist osa või kogu dokumendi. Kogu dokumentide tekst saadetakse ka privaatsesse otsinguindeksisse.

Konteksti täitmine tekstidokumentide puhul

See funktsioon on aktiivses arenduses. Seetõttu võivad järgmised üksikasjad ette teatamata muutuda.

ChatGPT Enterprise saab kontekstivaates töödelda üleslaaditud dokumentidest kuni 110k tokenit. Kui laadid üles ühe või mitu dokumenti, mille kogumaht on alla 110k tokeni, kaasatakse kogu sisu.

Kui üks dokument ületab 110k tokenit, kaasatakse ainult esimesed 110k tokenit, alustades algusest. Ülejäänu saadetakse ainult privaatsesse otsinguindeksisse.

Kui üles laaditakse mitu dokumenti ja nende kogumaht ületab 110k tokenit, kasutab ChatGPT Enterprise dokumentide esindatuse tasakaalustamiseks kaheastmelist protsessi:

  1. Ekstrakti kuni 55k tokenit, jagatuna üleslaaditud dokumentide vahel võrdselt.

  1. Dokumentide puhul, mis ei olnud esimeses etapis täielikult esindatud, eralda ülejäänud 55k tokenit proportsionaalselt iga dokumendi allesjäänud tokenite põhjal.

  1. Kõik ülejäänud tokenid saadetakse ainult privaatsesse otsinguindeksisse.

Tekstidokumendi tokenite arvu saad hinnata, kopeerides dokumendi teksti tööriista OpenAI Tokenizer.

Konteksti täitmine multimeedia-PDF-ide puhul

Kui kasutajad laadivad üles PDF-e, mis sisaldavad nii teksti kui ka pilte, võimaldab Visual Retrieval ChatGPT-l neid pilte töödelda natiivselt koos digitaalselt ekstraktitud tekstiga. Järgmised sammud täiendavad meie standardseid konteksti käsitlemise protseduure multimeedia-PDF-ide jaoks:

  • Piltide ekstraktimine ja manustamine: pildid ekstraktitakse ja manustatakse koos nendega seotud digitaalse tekstiga.

  • Nutikas skaleerimine: pilte skaleeritakse automaatselt, et säilitada tasakaal teabekvaliteedi ja saadaoleva kontekstivaate tõhusa kasutamise vahel.

Kui üleslaaditud PDF-id ületavad 110k tokeni piirangu, manustatakse nii pildid kui ka tekst privaatsesse otsinguindeksisse. Tekstimanused viitavad asjakohastele piltidele, võimaldades ChatGPT-l hankida kasutaja päringute põhjal sobivad teksti-pildi paarid. Hangitud pilte töödeldakse seejärel ChatGPT natiivsete multimodaalsete võimekuste abil.

Multimeedia-PDF-ide tokenivajaduste täpne hindamine on keeruline. Testimine näitab, et ligikaudu 350 lehekülge segateksti ja pilte kasutab 110k tokeni kontekstivaate täielikult ära.

Otsingustrateegiad mudeli tüübi põhjal

Nii GPT-seeria kui ka o-seeria mudelid toetavad failide üleslaadimist ning kasutavad identset konteksti täitmise ja otsingumanuste loogikat. Kõik mudelid teevad privaatse otsinguindeksi suhtes hübriidotsinguid, kombineerides märksõna- ja semantilisi meetodeid. Hübriidotsingus loob mudel kasutaja viiba põhjal otsingufraasi ning privaatne otsinguindeks hangib selle alusel asjakohase teksti ja pildid.

Need mudelid erinevad aga selle poolest, kuidas nad otsivad suurtest dokumentidest, mis ületavad kontekstivaate:

GPT-seeria mudelid

  • Üks otsing viiba kohta: GPT-seeria mudelid teevad iga kasutaja viiba puhul ühe otsingu.

  • Sobivad kasutusjuhud: ideaalne mahukas dokumentatsioonis leiduvatele lihtsatele küsimustele vastamiseks.

Näidispäringud:

  • „Millised on personalieeskirjad ennetähtaegse pensionile jäämise kohta?“

  • „Mida funktsioon process_order teeb?“

o-seeria mudelid

  • Mitu otsingut ühe viiba kohta: iga kasutaja viiba puhul saab teha mitu otsingut (tavaliselt 2–3), millest igaühel on ainulaadne otsingufraas. Otsingud tehakse järjest ning mudel saab varasemate otsingutega leitud teabe põhjal oma lähenemist muuta.

  • Sobivad kasutusjuhud: sobib paremini keerukatele küsimustele, mis nõuavad mahukast dokumentatsioonist mitut sihitud otsingut.

Näidispäringud:

  • „Millised on personalieeskirjad ennetähtaegse pensionile jäämise, vanemapuhkuse ja välismaale üleviimise kohta?“

  • „Selgita, mida funktsioon process_order teeb, loetle kõik selle kutsutavad meetodid ja kirjelda lühidalt iga meetodit.“

Oma tugevustest hoolimata võib o-seeria mudelitel tekkida raskusi, kui päring nõuab üle kolme otsingu.

Nõuanded failiotsingu tulemuste parandamiseks

  • Proovi keerukate küsimuste puhul, mis nõuavad mitut otsingut, kasutada o-seeria mudelit.

  • Pea meeles, et vastused võivad varieeruda sõltuvalt üleslaaditavate dokumentide tüübist, arvust ja suurusest.

  • Üldiselt annab väiksema arvu keskendunud dokumentide laadimine suurema täpsuse.

  • Muuda mitme küsimusega teemad üksikküsimusteks:

    • Kui pead teadma iga osariigi personalipoliitikaid, küsi nende kohta ükshaaval.

    • Kui pead kokku võtma palju dokumente, küsi ühe dokumendi kaupa. Kui see dokument on mitusada lehekülge pikk, kaalu selle jagamist väiksemateks osadeks.

      • Võid paluda ChatGPT Enterprise’il kirjutada „kokkuvõtete kokkuvõte”, kui annad talle tervete dokumentide asemel mitu kokkuvõtet.

    • Kui sul on RFP CSV-fail (iga rida on eri küsimus), esita need küsimused ükshaaval, selle asemel et lihtsalt CSV üles laadida ja üht vastust küsida.

  • Leia viise mudeli vastuste auditeerimiseks. GPT näidisjuhised on allpool:

# Kontekst 

Olete dokumentide mõistmise ekspert. Kasutaja lisab dokumendi ja esitab küsimuse. Tal peab olema võimalik siduda teie vastus tagasi täpse tekstiosaga, kust te vastuse võtsite.

# Juhised

1. Vastake kasutaja küsimusele tema lisatud dokumendi põhjal, kasutades allpool toodud täpset vormingut

# Vorming

- Küsimus: { korda kasutaja küsimust }
- Vastus: { esita vastus kasutaja küsimusele }
Allikas:
- - Jaotise number: { esita jaotise number, kust te vastuse võtsite }
- - Jaotise pealkiri: { esita jaotise pealkiri, kust te vastuse võtsite }
- - Täpne tekst: { esita täpne tekst, kust te vastuse võtsite }

# Reeglid

- Andke selgeid ja lühikesi vastuseid
- Esitage ainult dokumendis toodud teavet
- Kui te ei leia dokumendist vastust, vastake lihtsalt „Teavet ei leitud.”

Kas sellest artiklist oli abi?