OpenAI
Šo lapu tulkoja mašīntulks. Skatīt oriģinālo rakstu angļu valodā.

Failu augšupielādes optimizēšana pakalpojumā ChatGPT Enterprise

Uzziniet, kā ChatGPT Enterprise funkcijas apstrādā failus pēc to veida, skaita un lieluma. Uzlabojiet rezultātus atbilstoši failu prasībām.

Atjaunināts: 2 days ago

ChatGPT Enterprise tagad atbalsta vizuālo elementu (attēlu, grafiku, diagrammu u. c.) lasīšanu un izpratni, ja tie ir iegulti uzvednēs iekļautajos PDF failos. Lietotāji var augšupielādēt PDF failu, un ChatGPT var interpretēt tekstu un jebkurus vizuālos elementus šajā failā.

Plašāku informāciju skatiet sadaļā Bieži uzdotie jautājumi par vizuālo izgūšanu PDF failos.

ChatGPT Enterprise ļauj augšupielādēt failus vairākos veidos:

Šajā ceļvedī skaidrots, kā ChatGPT Enterprise funkcijas apstrādā failus atkarībā no to veida, skaita un lieluma, kā arī aplūkotas rezultātu uzlabošanas stratēģijas atbilstoši failu prasībām.

Kopsavilkums

ChatGPT Enterprise dažādu veidu failus apstrādā ļoti atšķirīgi: izgūst tekstu no PDF, prezentāciju un Word failiem, analizē izklājlapu strukturētos datus ar Python kodu un apraksta attēlu failus, izmantojot GPT Vision. Lai iegūtu gaidīto rezultātu, ir svarīgi saprast, kuru darbplūsmu aktivizē katrs faila veids.

Apstrādājot teksta dokumentus, ChatGPT Enterprise tieši kopā ar uzvedni iekļauj pēc iespējas vairāk atbilstošā teksta un izmanto meklēšanas sistēmu, lai piekļūtu papildu informācijai. Šī pieeja labi noder, lai atbildētu uz konkrētiem jautājumiem. Tomēr tā var nebūt piemērota sarežģītiem uzdevumiem, piemēram, ļoti lielu dokumentu apkopošanai vai vairāku lielu failu salīdzināšanai. Lasiet tālāk, lai uzzinātu, kā uzlabot rezultātus.

Failu apstrāde atkarībā no to veida

ChatGPT Enterprise apstrādā failus trīs galvenajos veidos: izgūst tekstu, analizē kodu un interpretē attēlus. Faila veids nosaka, kuru darbplūsmu izmanto ChatGPT Enterprise.

Teksta izguveKoda interpretētājsAttēlu apstrādeVizuālā izguve
Failu veidu piemēripptx, docx, txt, md, json, xml, pdf*
* PDF faili, kas augšupielādēti kā

GPT zināšanas
vai

projekta faili
csv, xls, xlsx*
*Piezīme. Koda interpretētājs var apstrādāt jebkura veida failu, taču izklājlapām ChatGPT Enterprise visbiežāk pēc noklusējuma izmanto Koda interpretētāju.
jpg, pngpdf*
* Lietotāja uzvednēs iekļautie PDF faili
DarbībaIzgūst tekstu no faila — daļa teksta tiek tieši ievietota konteksta logā, bet pārējais tiek saglabāts meklēšanai.Koda interpretētājs nodod failu apstrādei ar Python.Attēlus tieši interpretē multimodālie modeļi, ievērojot

zināmos ierobežojumus
.
Teksta izguves un attēlu apstrādes apvienojums. Teksts tiek digitāli izgūts, bet vizuālo saturu tieši interpretē multimodālie modeļi.

Failiem, kuros ir tikai teksts vai attēli, kā arī skaidri strukturētu datu failiem (piemēram, Excel darījumu tabulai) šis iedalījums nodrošina vislabāko iespējamo darbību.

Tomēr ir arī mazāk skaidri gadījumi, piemēram:

  • Attēli, kas iegulti failos, kuri nav PDF faili, netiek apstrādāti. Lai tos iekļautu, pirms augšupielādes konvertējiet failu PDF formātā.

  • ChatGPT Enterprise darbam ar izklājlapām vienmēr izmanto Koda interpretētāju, pat ja dokumentā ir daudz teksta. Piemēram, ja lūgsiet ChatGPT Enterprise iztulkot CSV failu ar 10 teksta rindām, tas mēģinās tulkot failu, izmantojot Python bibliotēku. Šī pieeja ir mazāk precīza nekā tulkojums, ko tieši ģenerē modelis. Lai mazinātu šo problēmu, mēģiniet eksportēt izklājlapu teksta formātā, piemēram, PDF.

  • Tāpat, ja augšupielādēsiet JSON failu ar strukturētu darījumu tabulu, ChatGPT Enterprise interpretēs šo failu kā vienkāršu tekstu. Ja vēlaties analizēt JSON failā ietvertos datus, uzvednē norādiet modelim izmantot Koda interpretētāju.

Failu apstrāde atkarībā no izmēra

ChatGPT Enterprise izmanto modeļus ar maksimālo konteksta logu 128 tūkst. tekstvienību (aptuveni 200 teksta lapas). Tomēr ne visas tekstvienības tiek izmantotas, lai iekļautu tekstu no augšupielādētajiem failiem. „Aizpildīto” tekstvienību skaits atšķiras atkarībā no lietojuma veida.

ChatGPT Enterprise „aizpilda” noteiktu teksta apjomu, un atlikušais teksts tiek nosūtīts uz privātu meklēšanas indeksu („vektoru krātuvi”, kas ir datubāzes veids, kas paredzēts liela teksta apjoma efektīvai glabāšanai un izgūšanai). Kad uzdodat jautājumu, ChatGPT Enterprise iekļauj ietverto tekstu kopā ar atbilstošiem fragmentiem, kas izgūti no privāta meklēšanas indeksa.

Ja augšupielādējat vienu dokumentu, ChatGPT Enterprise iekļauj tekstu no sākuma, līdz tiek sasniegts limits. Ja augšupielādējat vairākus dokumentus, ChatGPT Enterprise iekļauj daļu no katra dokumenta vai visu dokumentu. Viss dokumentu teksts tiek nosūtīts arī uz privātu meklēšanas indeksu.

Konteksta aizpildīšana teksta dokumentiem

Šī funkcija tiek aktīvi izstrādāta. Tādēļ tālāk norādītā informācija var mainīties bez iepriekšēja brīdinājuma.

ChatGPT Enterprise konteksta logā var apstrādāt līdz 110 tūkst. tekstvienību no augšupielādētajiem dokumentiem. Ja augšupielādējat vienu vai vairākus dokumentus, kuru kopējais apjoms ir mazāks par 110 tūkst. tekstvienību, tiks iekļauts pilns saturs.

Vienam dokumentam, kas pārsniedz 110 tūkst. tekstvienību, tiks iekļautas tikai pirmās 110 tūkst. tekstvienību, sākot no sākuma. Atlikusī daļa tiks nosūtīta tikai uz privāto meklēšanas indeksu.

Ja tiek augšupielādēti vairāki dokumenti un to kopējais apjoms pārsniedz 110 tūkst. tekstvienību, ChatGPT Enterprise izmanto divpakāpju procesu, lai līdzsvarotu dokumentu pārstāvību:

  1. Izgūst līdz 55 tūkst. tekstvienību, kas vienmērīgi sadalītas starp augšupielādētajiem dokumentiem.

  1. Dokumentiem, kas pirmajā solī nav pilnībā pārstāvēti, atlikušās 55 tūkst. tekstvienību piešķir proporcionāli, pamatojoties uz katrā dokumentā atlikušajām tekstvienībām.

  1. Visas atlikušās tekstvienības tiek nosūtītas tikai uz privāto meklēšanas indeksu.

Tekstvienību skaitu teksta dokumentā varat aptuveni noteikt, iekopējot dokumenta tekstu rīkā OpenAI Tokenizer.

Konteksta aizpildīšana multivides PDF failiem

Kad lietotāji augšupielādē PDF failus, kuros ir gan teksts, gan attēli, vizuālā izgūšana ļauj ChatGPT apstrādāt šos attēlus sākotnējā veidā kopā ar digitāli izgūto tekstu. Tālāk norādītās darbības papildina mūsu standarta konteksta apstrādes procedūras multivides PDF failiem:

  • Attēlu izgūšana un iegulšana: attēli tiek izgūti un iegulti kopā ar saistīto digitālo tekstu.

  • Viedā mērogošana: attēli tiek automātiski mērogoti, lai saglabātu līdzsvaru starp informācijas kvalitāti un pieejamā konteksta loga efektīvu izmantošanu.

Kad augšupielādētie PDF faili pārsniedz 110 tūkst. tekstvienību limitu, gan attēli, gan teksts tiek iegulti privātajā meklēšanas indeksā. Teksta iegulumi atsaucas uz atbilstošiem attēliem, ļaujot ChatGPT izgūt piemērotos teksta un attēlu pārus, pamatojoties uz lietotāju vaicājumiem. Pēc tam izgūtie attēli tiek apstrādāti, izmantojot ChatGPT sākotnējās multimodālās iespējas.

Precīzi novērtēt tekstvienību prasības multivides PDF failiem ir sarežģīti. Testēšana liecina, ka aptuveni 350 lapas ar jauktu tekstu un attēliem pilnībā izmantos 110 tūkst. tekstvienību konteksta logu.

Meklēšanas stratēģijas atkarībā no modeļa veida

Gan GPT sērijas, gan o sērijas modeļi atbalsta failu augšupielādi un izmanto identisku konteksta aizpildīšanas un meklēšanas iegulumu loģiku. Visi modeļi izpilda hibrīdos meklējumus privātā meklēšanas indeksā, apvienojot atslēgvārdu un semantiskās metodes. Hibrīdā meklēšanā modelis ģenerē meklēšanas frāzi, pamatojoties uz lietotāja uzvedni, un privātais meklēšanas indekss attiecīgi izgūst atbilstošu tekstu un attēlus.

Tomēr šie modeļi atšķiras ar to, kā tie meklē lielos dokumentos, kas pārsniedz konteksta logu:

GPT sērijas modeļi

  • Viens meklējums vienai uzvednei: GPT sērijas modeļi katrai lietotāja uzvednei veic vienu meklējumu.

  • Piemērotākie lietojumi: vienkāršu jautājumu atbildēšana, meklējot informāciju plašā dokumentācijā.

Vaicājumu piemēri:

  • „Kādi ir personāla politikas noteikumi par priekšlaicīgu pensionēšanos?“

  • „Ko dara funkcija process_order?“

o sērijas modeļi

  • Vairāki meklējumi vienai uzvednei: katrai lietotāja uzvednei var veikt vairākus meklējumus (parasti 2–3), katru ar unikālu meklēšanas frāzi. Meklējumi tiek veikti secīgi, un modelis var pielāgot pieeju, pamatojoties uz iepriekšējos meklējumos iegūto informāciju.

  • Piemērotākie lietojumi: sarežģīti jautājumi, kuru atbildēšanai plašā dokumentācijā jāveic vairāki mērķēti meklējumi.

Vaicājumu piemēri:

  • „Kādi ir personāla politikas noteikumi par priekšlaicīgu pensionēšanos, bērna kopšanas atvaļinājumu un pārcelšanu darbā uz ārvalstīm?“

  • „Paskaidro, ko dara funkcija process_order, uzskaiti visas tās izsauktās metodes un īsi apraksti katru no tām.“

Neraugoties uz to priekšrocībām, o sērijas modeļiem var rasties grūtības, ja vaicājuma izpildei vajadzīgi vairāk nekā trīs meklējumi.

Padomi failu meklēšanas rezultātu uzlabošanai

  • Sarežģītiem jautājumiem, kam nepieciešami vairāki meklējumi, mēģiniet izmantot o sērijas modeli.

  • Atcerieties, ka atbildes var atšķirties atkarībā no augšupielādēto dokumentu veida, skaita un izmēra.

  • Kopumā mazāka skaita mērķētu dokumentu ielāde nodrošinās augstāku precizitāti.

  • Pārvērtiet tēmas ar vairākiem jautājumiem par atsevišķiem jautājumiem:

    • Ja jums jāzina katras pavalsts personāla politikas, jautājiet par tām pa vienai.

    • Ja jums jāapkopo daudzi dokumenti, lūdziet apkopot pa vienam dokumentam. Ja šim dokumentam ir daudzi simti lapu, apsveriet iespēju to sadalīt mazākās daļās.

      • Varat lūgt ChatGPT Enterprise uzrakstīt „kopsavilkumu kopsavilkumu”, ja ievadāt vairākus kopsavilkumus, nevis veselus dokumentus.

    • Ja jums ir RFP CSV fails (katrā rindā ir atšķirīgs jautājums), uzdodiet šos jautājumus pa vienam, nevis vienkārši ielādējiet CSV un pieprasiet vienu atbildi.

  • Atrodiet veidus, kā auditēt modeļa atbildes. GPT norādījumu piemēri ir tālāk:

# Konteksts 

Jūs esat eksperts dokumentu izpratnē. Lietotājs pievienos dokumentu un uzdos jautājumu. Viņam jāspēj sasaistīt jūsu atbildi ar precīzu teksta vietu, no kuras jūs ieguvāt atbildi.

# Instrukcijas

1. Atbildiet uz lietotāja jautājumu, pamatojoties uz viņa pievienoto dokumentu, izmantojot tieši tālāk norādīto formātu

# Formāts

- Jautājums: { atkārtojiet lietotāja jautājumu }
- Atbilde: { sniedziet atbildi uz lietotāja jautājumu }
Avots:
- - Sadaļas numurs: { norādiet sadaļas numuru, no kuras paņēmāt atbildi }
- - Sadaļas nosaukums: { norādiet sadaļas nosaukumu, no kuras paņēmāt atbildi }
- - Precīzs teksts: { norādiet precīzu tekstu, no kura paņēmāt atbildi }

# Noteikumi

- Sniedziet skaidras un kodolīgas atbildes
- Sniedziet tikai dokumentā norādīto informāciju
- Ja nevarat atrast atbildi dokumentā, vienkārši atbildiet: “Informācija nav atrasta.”

Vai šis raksts bija noderīgs?