Sinusuportahan na ngayon ng ChatGPT Enterprise ang pagbabasa at pag-unawa ng mga visual (mga larawan, graph, diagram, atbp.) na naka-embed sa mga PDF file na kasama sa mga prompt. Maaaring mag-upload ang mga user ng PDF, at kayang bigyang-kahulugan ng ChatGPT ang text at anumang visual element sa loob ng file na iyon.
Para sa mga detalye, tingnan ang FAQ sa Visual Retrieval gamit ang mga PDF.
Maaari kang mag-upload ng mga file sa ChatGPT Enterprise sa ilang paraan:
Direkta mula sa iyong computer
Bilang Kaalaman ng GPT
Bilang File ng Proyekto
Mula sa isang Aksyon ng GPT
Ipinapaliwanag ng gabay na ito kung paano pinangangasiwaan ng mga feature ng ChatGPT Enterprise ang mga file batay sa uri, dami, at laki ng mga ito, at tinatalakay ang mga paraan upang mapahusay ang mga output batay sa mga kinakailangan ng file.
Buod
Iba-iba ang pagproseso ng ChatGPT Enterprise sa bawat uri ng file: kinukuha nito ang teksto mula sa mga dokumentong gaya ng PDF, presentation, at Word file; sinusuri ang structured data mula sa mga spreadsheet gamit ang Python code; at inilalarawan ang mga image file sa pamamagitan ng GPT-Vision. Mahalagang maunawaan kung aling workflow ang ginagamit para sa bawat uri ng file upang makuha ang inaasahang resulta.
Para sa mga dokumentong nakabatay sa teksto, direktang isinasama ng ChatGPT Enterprise sa prompt ang pinakamaraming nauugnay na teksto hangga't maaari at gumagamit ito ng search system upang ma-access ang karagdagang impormasyon. Epektibo ito sa pagsagot sa mga partikular na tanong. Gayunpaman, maaaring mahirapan ang paraang ito sa mga komplikadong gawain gaya ng pagbubuod ng napakalalaking dokumento o paghahambing ng maraming malalaking file. Magpatuloy sa pagbabasa upang malaman ang mga paraan ng pagpapahusay sa iyong mga resulta.
Pangangasiwa sa mga file batay sa uri
Pinoproseso ng ChatGPT Enterprise ang mga file sa tatlong pangunahing paraan: pagkuha ng teksto, pagsusuri gamit ang code, at interpretasyon ng larawan. Ang uri ng file ang tumutukoy kung aling workflow ang susundin ng ChatGPT Enterprise.
| Pagkuha Batay sa Teksto | Code Interpreter | Pagproseso ng Larawan | Visual na Pagkuha | |
|---|---|---|---|---|
| Mga Halimbawa ng Uri ng File | pptx, docx, txt, md, json, xml, pdf* * Mga PDF na na-upload bilang Kaalaman ng GPT o Mga File ng Proyekto | csv, xls, xlsx* *Tandaan: Maaaring gamitin ng Code Interpreter ang anumang uri ng file, ngunit karaniwang CI ang awtomatikong ginagamit ng ChatGPT Enterprise para sa mga spreadsheet | jpg, png | pdf* * Mga PDF na kasama sa mga prompt ng user |
| Gawi | Kinukuha ang teksto mula sa file—ang ilang bahagi ay direktang inilalagay (“isinisingit”) sa context window, habang iniimbak ang iba pang teksto para sa paghahanap | Ipinapasa ng Code Interpreter ang file sa Python para iproseso | Likas na binibigyang-kahulugan ng mga multi-modal na modelo ang mga larawan, alinsunod sa mga kilalang limitasyon . | Pinagsamang pagkuha ng teksto at pagproseso ng larawan. Digital na kinukuha ang teksto, at likas na binibigyang-kahulugan ng mga multi-modal na modelo ang visual na nilalaman. |
Para sa mga text-only na file, image file, o mga file ng data na malinaw ang istruktura (hal., talahanayan ng mga transaksyon sa Excel), ang mga pagkakahating ito ang kumakatawan sa pinakamainam na posibleng gawi.
May ilang sitwasyong hindi gaanong malinaw, halimbawa:
Hindi pinoproseso ang mga larawang naka-embed sa mga file na hindi PDF. Upang maisama ang mga ito, i-convert muna ang file sa PDF bago ito i-upload.
Palaging gagamit ang ChatGPT Enterprise ng Code Interpreter upang gamitin ang mga spreadsheet, kahit napakaraming teksto ang nilalaman ng dokumento. Halimbawa, kung hihilingin mo sa ChatGPT Enterprise na isalin ang isang CSV file na may 10 row ng teksto, susubukan nitong isalin ang file gamit ang isang Python library. Hindi ito kasing-tumpak ng direktang pagpapagawa ng salin sa modelo. Upang mabawasan ang problemang ito, subukang i-export ang spreadsheet sa format na nakabatay sa teksto (halimbawa, PDF).
Gayundin, kung mag-a-upload ka ng structured na talahanayan ng mga transaksyon na nasa isang JSON file, ituturing ito ng ChatGPT Enterprise bilang plain text. Kung gusto mong suriin ang data sa isang JSON file, atasan ang modelo sa iyong prompt na gamitin ang Code Interpreter.
Pangangasiwa ng mga file batay sa laki
Gumagamit ang ChatGPT Enterprise ng mga modelo na may maximum na context window na 128k token (humigit-kumulang 200 pahina ng text). Gayunpaman, hindi lahat ng token ay ginagamit para isama ang text mula sa mga na-upload na file. Nag-iiba ang bilang ng mga “stuffed” na token ayon sa uri ng paggamit.
“Ini-stuff” ng ChatGPT Enterprise ang ilang dami ng text, at ang natitirang text ay ipinapadala sa isang pribadong search index (isang “vector store”, na isang uri ng database na idinisenyo upang mahusay na mag-imbak at kumuha ng malalaking dami ng text). Kapag nagtanong ka, isinasama ng ChatGPT Enterprise ang nakasamang text kasama ng mga nauugnay na chunk na nakuha mula sa isang pribadong search index.
Kung mag-a-upload ka ng isang dokumento, isinasama ng ChatGPT Enterprise ang text mula sa simula hanggang maabot nito ang limitasyon nito. Kung mag-a-upload ka ng maraming dokumento, isinasama ng ChatGPT Enterprise ang ilan o lahat ng bahagi ng bawat dokumento. Ipinapadala rin ang lahat ng text mula sa mga dokumento sa isang pribadong search index.
Context stuffing para sa mga text document
Ang feature na ito ay nasa aktibong pag-develop. Kaya, ang mga sumusunod na detalye ay maaaring magbago nang walang abiso.
Kayang iproseso ng ChatGPT Enterprise ang hanggang 110k token mula sa mga na-upload na dokumento sa context window. Kung mag-a-upload ka ng isa o higit pang dokumento na ang pinagsamang kabuuan ay mas mababa sa 110k token, isasama ang buong nilalaman.
Para sa isang dokumentong lumalampas sa 110k token, ang unang 110k token lang ang isasama, simula sa umpisa. Ang natitira ay ipapadala lamang sa pribadong search index.
Kung maraming dokumento ang na-upload at lumampas sa 110k token ang pinagsamang kabuuan ng mga ito, gumagamit ang ChatGPT Enterprise ng dalawang hakbang na proseso para balansehin ang representasyon ng dokumento:
Mag-extract ng hanggang 55k token, na hinati nang pantay-pantay sa mga na-upload na dokumento.
Para sa mga dokumentong hindi ganap na narepresenta sa unang hakbang, ilaan ang natitirang 55k token nang proporsyonal batay sa mga token na natitira sa bawat dokumento.
Ang anumang natitirang token ay ipinapadala lamang sa pribadong search index.
Matatantiya mo ang bilang ng mga token sa isang text document sa pamamagitan ng pagkopya ng text ng dokumento sa OpenAI Tokenizer.
Context stuffing para sa mga multimedia PDF
Kapag nag-upload ang mga user ng mga PDF na naglalaman ng parehong text at mga larawan, pinapagana ng Visual Retrieval ang ChatGPT na iproseso ang mga larawang ito nang native kasabay ng digitally extracted na text. Dinadagdagan ng mga sumusunod na hakbang ang aming karaniwang mga pamamaraan sa paghawak ng context para sa mga multimedia PDF:
Pag-extract at Pag-embed ng Larawan: Ine-extract at ini-embed ang mga larawan kasama ang nauugnay na digital text ng mga ito.
Intelligent Scaling: Awtomatikong ini-scale ang mga larawan para mapanatili ang balanse sa pagitan ng kalidad ng impormasyon at episyenteng paggamit ng available na context window.
Kapag lumampas ang mga na-upload na PDF sa limitasyong 110k token, parehong ini-embed ang mga larawan at text sa pribadong search index. Tinutukoy ng mga text embedding ang mga nauugnay na larawan, kaya nakakakuha ang ChatGPT ng angkop na mga pares ng text at larawan batay sa mga query ng user. Pagkatapos, pinoproseso ang mga nakuhang larawan gamit ang native na multimodal na kakayahan ng ChatGPT.
Mahirap tantiyahin nang tumpak ang mga kinakailangang token para sa mga multimedia PDF. Ipinapahiwatig ng testing na humigit-kumulang 350 pahina ng pinaghalong text at mga larawan ang ganap na gagamit sa 110k token na context window.
Mga strategy sa paghahanap batay sa uri ng modelo
Parehong sumusuporta ang mga modelo ng GPT-series at o-series sa pag-upload ng file at gumagamit ng magkaparehong context stuffing at logic ng search embedding. Nagsasagawa ang lahat ng modelo ng mga hybrid na paghahanap sa isang pribadong search index, na pinagsasama ang mga pamamaraang keyword at semantic. Sa hybrid na paghahanap, bumubuo ang modelo ng parirala sa paghahanap batay sa prompt ng user, at kinukuha ng pribadong search index ang nauugnay na text at mga larawan ayon dito.
Gayunpaman, nagkakaiba ang mga modelong ito sa paraan ng paghahanap nila sa malalaking dokumentong lumalampas sa context window:
mga modelo ng GPT-series
Isang paghahanap sa bawat prompt: Nagsasagawa ang mga modelo ng GPT-series ng isang paghahanap sa bawat prompt ng user.
Mga angkop na gamit: Mainam para sa pagsagot sa mga simpleng tanong na nasa malawak na dokumentasyon.
Mga halimbawang query:
"Ano ang patakaran ng HR para sa maagang pagreretiro?"
"Ano ang ginagawa ng function na process_order?"
mga modelo ng o-series
Maraming paghahanap sa bawat prompt: Maaaring magsagawa ng maraming paghahanap (karaniwan ay 2–3) sa bawat prompt ng user, gamit ang magkakaibang parirala sa paghahanap. Sunod-sunod na isinasagawa ang mga paghahanap, at maaaring baguhin ng modelo ang paraan nito batay sa impormasyong nakuha sa mga naunang paghahanap.
Mga angkop na gamit: Mas angkop sa mga komplikadong tanong na nangangailangan ng maraming naka-target na paghahanap sa malawak na dokumentasyon.
Mga halimbawang query:
"Ano ang mga patakaran ng HR para sa maagang pagreretiro, parental leave, at paglipat sa ibang bansa?"
"Ipaliwanag kung ano ang ginagawa ng function na process_order, ilista ang lahat ng method na tinatawag nito, at maikling ilarawan ang bawat isa."
Sa kabila ng mga kalakasan ng mga ito, maaaring mahirapan ang mga modelo ng o-series kapag nangangailangan ang isang query ng higit sa tatlong paghahanap.
Mga tip para mapahusay ang mga resulta ng file search
Subukang gumamit ng modelo ng o-series para sa mga komplikadong tanong na nangangailangan ng maraming paghahanap.
Tandaan na maaaring mag-iba ang mga sagot depende sa uri, bilang, at laki ng mga dokumentong ina-upload mo.
Sa pangkalahatan, hahantong sa mas mataas na katumpakan ang pag-load ng mas kaunti at nakatuong mga dokumento.
Gawing iisang tanong ang mga paksang maraming tanong:
Kung kailangan mong malaman ang mga patakaran ng HR ng bawat estado, itanong ang mga ito nang paisa-isa.
Kung kailangan mong ibuod ang maraming dokumento, humingi ng isang dokumento sa bawat pagkakataon. Kung ang dokumentong iyon ay maraming daang pahina, isaalang-alang na hatiin ito sa mas maliliit na bahagi.
Maaari mong hilingin sa ChatGPT Enterprise na magsulat ng “buod ng mga buod” kung bibigyan mo ito ng maraming buod sa halip na buong mga dokumento.
Kung mayroon kang CSV ng isang RFP (bawat linya ay ibang tanong), itanong ang mga iyon nang paisa-isa sa halip na i-load lang ang CSV at humiling ng isang sagot.
Humanap ng mga paraan para i-audit ang mga sagot ng modelo. Nasa ibaba ang mga halimbawang tagubilin para sa GPT:
# Konteksto
Eksperto ka sa pag-unawa ng mga dokumento. Mag-a-attach ang user ng isang dokumento at magtatanong. Kailangan nilang maiugnay ang iyong sagot pabalik sa eksaktong bahagi ng teksto kung saan mo kinuha ang iyong sagot.
# Mga Tagubilin
1. Sagutin ang tanong ng user batay sa naka-attach nilang dokumento gamit ang eksaktong format na ibinigay sa ibaba
# Format
- Tanong: { ulitin ang tanong ng user }
- Sagot: { magbigay ng sagot sa tanong ng user }
Pinagmulan:
- - Numero ng Seksyon: { ibigay ang numero ng seksyon kung saan mo kinuha ang sagot }
- - Pamagat ng Seksyon: { ibigay ang pamagat ng seksyon kung saan mo kinuha ang sagot }
- - Eksaktong Teksto: { ibigay ang eksaktong teksto kung saan mo kinuha ang sagot }
# Mga Panuntunan
- Magbigay ng mga sagot na malinaw at maikli
- Tanging impormasyong ibinigay sa dokumento ang ilahad
- Kung hindi mo mahanap ang sagot sa dokumento, tumugon lamang ng “Walang nakitang impormasyon.”