ChatGPT Enterprise kini menyokong pembacaan dan pemahaman visual (imej, graf, rajah dan sebagainya) yang dibenamkan dalam fail PDF yang disertakan dalam prom. Pengguna boleh memuat naik PDF, dan ChatGPT boleh mentafsir teks serta sebarang elemen visual dalam fail tersebut.
Untuk butiran, lihat Soalan Lazim Visual Retrieval dengan PDF.
ChatGPT Enterprise membolehkan anda memuat naik fail melalui beberapa cara:
Terus daripada komputer anda
Daripada Google Drive / SharePoint / OneDrive
Sebagai GPT Knowledge
Sebagai Project File
Daripada GPT Action
Panduan ini menerangkan cara ciri ChatGPT Enterprise mengendalikan fail berdasarkan jenis, bilangan dan saiznya, serta membincangkan strategi untuk meningkatkan output berdasarkan keperluan fail.
Ringkasan
ChatGPT Enterprise mengendalikan jenis fail yang berbeza dengan cara yang sangat berbeza: mengekstrak teks daripada dokumen teks seperti PDF, pembentangan dan fail Word, menganalisis data berstruktur daripada hamparan menggunakan kod Python, dan menerangkan fail imej melalui GPT-Vision. Memahami jenis fail yang mencetuskan aliran kerja tertentu adalah kunci untuk mendapatkan hasil yang dijangka.
Untuk dokumen berasaskan teks, ChatGPT Enterprise menyertakan sebanyak mungkin teks berkaitan terus bersama prom dan menggunakan sistem carian untuk mengakses maklumat tambahan. Ini berfungsi dengan baik untuk menjawab soalan khusus. Walau bagaimanapun, pendekatan ini boleh menghadapi kesukaran dengan tugas kompleks seperti meringkaskan dokumen yang sangat besar atau membandingkan berbilang fail besar. Teruskan membaca untuk memahami strategi bagi meningkatkan hasil anda.
Mengendalikan fail berdasarkan jenis
ChatGPT Enterprise memproses fail melalui tiga cara utama: pengekstrakan teks, analisis kod dan pentafsiran imej. Jenis fail menentukan aliran kerja yang diikuti oleh ChatGPT Enterprise.
| Dapatan Semula Berasaskan Teks | Code Interpreter | Pemprosesan Imej | Visual Retrieval | |
|---|---|---|---|---|
| Contoh Jenis Fail | pptx, docx, txt, md, json, xml, pdf* * PDF yang dimuat naik sebagai GPT Knowledge atau Project Files | csv, xls, xlsx* *Nota: Code Interpreter boleh beroperasi pada apa-apa jenis fail, tetapi ChatGPT Enterprise paling kerap menggunakan CI secara lalai untuk hamparan | jpg, png | pdf* * PDF yang disertakan dalam prom pengguna |
| Tingkah Laku | Mengekstrak teks daripada fail – sebahagian teks ditampal (“disisipkan”) terus ke dalam tetingkap konteks; sebahagian teks disimpan untuk carian | Code Interpreter menyerahkan fail kepada Python untuk diproses | Imej ditafsir secara natif oleh model multimodal, tertakluk pada batasan yang diketahui . | Gabungan antara dapatan semula teks dan pemprosesan imej. Teks diekstrak secara digital, dan kandungan visual ditafsir secara natif oleh model multimodal. |
Untuk fail teks sahaja, fail imej atau fail data yang jelas berstruktur (cth., jadual transaksi Excel), pembahagian ini mewakili tingkah laku terbaik yang mungkin.
Terdapat beberapa kawasan kelabu yang kurang jelas, contohnya:
Imej yang dibenamkan dalam fail selain PDF tidak diproses. Untuk menyertakannya, tukar fail kepada PDF sebelum memuat naik.
ChatGPT Enterprise akan sentiasa menggunakan Code Interpreter untuk berinteraksi dengan hamparan, walaupun dokumen mengandungi banyak teks. Contohnya, jika anda meminta ChatGPT Enterprise menterjemah fail CSV dengan 10 baris teks, ia akan cuba menterjemah fail itu menggunakan pustaka Python, yang kurang tepat berbanding membenarkan model menjana terjemahan secara langsung. Untuk mengurangkan masalah ini, cuba eksport hamparan kepada format berasaskan teks (PDF, contohnya).
Begitu juga, jika anda memuat naik jadual transaksi berstruktur yang terkandung dalam fail JSON, ChatGPT Enterprise akan mentafsir fail ini sebagai teks biasa. Jika anda ingin menganalisis data yang terkandung dalam fail JSON, arahkan model supaya menggunakan Code Interpreter dalam prom anda.
Mengendalikan fail berdasarkan saiz
ChatGPT Enterprise menggunakan model dengan tetingkap konteks maksimum 128k token (kira-kira 200 halaman teks). Walau bagaimanapun, bukan semua token digunakan untuk memasukkan teks daripada fail yang dimuat naik. Bilangan token yang “disisipkan” berbeza mengikut jenis penggunaan.
ChatGPT Enterprise "menyisipkan" sejumlah teks, dan teks selebihnya dihantar ke indeks carian peribadi (sebuah "stor vektor", iaitu sejenis pangkalan data yang direka untuk menyimpan dan mendapatkan semula sejumlah besar teks dengan cekap). Apabila anda bertanya soalan, ChatGPT Enterprise membawa masuk teks yang disertakan bersama cebisan berkaitan yang diperoleh daripada indeks carian peribadi.
Jika anda memuat naik satu dokumen, ChatGPT Enterprise menyertakan teks bermula dari awal sehingga hadnya dicapai. Jika anda memuat naik berbilang dokumen, ChatGPT Enterprise menyertakan sebahagian atau semua kandungan setiap dokumen. Semua teks daripada dokumen turut dihantar ke indeks carian peribadi.
Penyisipan konteks untuk dokumen teks
Ciri ini sedang giat dibangunkan. Oleh itu, butiran berikut tertakluk pada perubahan tanpa notis.
ChatGPT Enterprise boleh memproses sehingga 110k token daripada dokumen yang dimuat naik dalam tetingkap konteks. Jika anda memuat naik satu atau lebih dokumen dengan jumlah gabungan kurang daripada 110k token, kandungan penuh akan disertakan.
Untuk satu dokumen yang melebihi 110k token, hanya 110k token pertama akan disertakan, bermula dari awal. Bakinya hanya akan dihantar ke indeks carian peribadi.
Jika berbilang dokumen dimuat naik dan jumlah gabungannya melebihi 110k token, ChatGPT Enterprise menggunakan proses dua langkah untuk mengimbangi perwakilan dokumen:
Ekstrak sehingga 55k token, dibahagikan sama rata antara dokumen yang dimuat naik.
Untuk dokumen yang tidak diwakili sepenuhnya dalam langkah pertama, peruntukkan baki 55k token secara berkadar berdasarkan token yang tinggal dalam setiap dokumen.
Sebarang token yang masih berbaki hanya dihantar ke indeks carian peribadi.
Anda boleh menganggarkan bilangan token dalam dokumen teks dengan menyalin teks dokumen ke dalam OpenAI Tokenizer.
Penyisipan konteks untuk PDF multimedia
Apabila pengguna memuat naik PDF yang mengandungi teks dan imej, Visual Retrieval membolehkan ChatGPT memproses imej ini secara natif bersama teks yang diekstrak secara digital. Langkah berikut melengkapkan prosedur pengendalian konteks standard kami untuk PDF multimedia:
Pengekstrakan dan Pembenaman Imej: Imej diekstrak dan dibenamkan bersama teks digital yang berkaitan dengannya.
Penskalaan Pintar: Imej diskalakan secara automatik untuk mengekalkan keseimbangan antara kualiti maklumat dan penggunaan tetingkap konteks yang tersedia secara cekap.
Apabila PDF yang dimuat naik melebihi had 110k token, kedua-dua imej dan teks dibenamkan dalam indeks carian peribadi. Pembenaman teks merujuk imej yang berkaitan, membolehkan ChatGPT mendapatkan pasangan teks-imej yang sesuai berdasarkan pertanyaan pengguna. Imej yang diperoleh kemudian diproses menggunakan keupayaan multimodal natif ChatGPT.
Menganggarkan keperluan token untuk PDF multimedia dengan tepat adalah mencabar. Ujian menunjukkan bahawa kira-kira 350 halaman teks dan imej bercampur akan menggunakan sepenuhnya tetingkap konteks 110k token.
Strategi carian berdasarkan jenis model
Kedua-dua model GPT-series dan o-series menyokong muat naik fail serta menggunakan logik penyisipan konteks dan pembenaman carian yang sama. Semua model menjalankan carian hibrid terhadap indeks carian peribadi, dengan menggabungkan kaedah kata kunci dan semantik. Dalam carian hibrid, model menjana frasa carian berdasarkan prom pengguna, dan indeks carian peribadi mendapatkan teks serta imej yang berkaitan sewajarnya.
Walau bagaimanapun, model-model ini berbeza dari segi cara mereka mencari dalam dokumen besar yang melebihi tetingkap konteks:
model GPT-series
Satu carian bagi setiap prom: Model GPT-series menjalankan satu carian bagi setiap prom pengguna.
Kes penggunaan berkesan: Sesuai untuk menjawab soalan ringkas yang terkandung dalam dokumentasi yang luas.
Contoh pertanyaan:
"Apakah dasar HR untuk persaraan awal?"
"Apakah yang dilakukan oleh fungsi
process_order?"
model o-series
Berbilang carian bagi setiap prom: Boleh menjalankan berbilang carian (biasanya 2-3) bagi setiap prom pengguna, setiap satu dengan frasa carian yang unik. Carian dijalankan secara berurutan, dan model boleh mengemas kini pendekatannya berdasarkan maklumat yang diperoleh dalam carian terdahulu.
Kes penggunaan berkesan: Lebih sesuai untuk soalan kompleks yang memerlukan berbilang carian tersasar merentas dokumentasi yang luas.
Contoh pertanyaan:
"Apakah dasar HR untuk persaraan awal, cuti ibu bapa dan pertukaran ke luar negara?"
"Terangkan fungsi
process_order, senaraikan semua kaedah yang dipanggil oleh fungsi ini, dan huraikan secara ringkas setiap kaedah yang dipanggil."
Walaupun mempunyai kelebihan, model o-series mungkin menghadapi kesukaran apabila pertanyaan memerlukan lebih daripada tiga carian.
Petua untuk meningkatkan hasil carian fail
Cuba gunakan model o-series untuk soalan kompleks yang memerlukan berbilang carian.
Ingat bahawa respons mungkin berbeza bergantung pada jenis, bilangan dan saiz dokumen yang anda muat naik.
Secara umum, memuatkan dokumen yang lebih sedikit dan berfokus akan menghasilkan ketepatan yang lebih tinggi.
Tukar topik berbilang soalan kepada soalan tunggal:
Jika anda perlu mengetahui dasar HR setiap negeri, tanyakannya satu demi satu.
Jika anda perlu meringkaskan banyak dokumen, minta satu dokumen pada satu masa. Jika dokumen itu mempunyai ratusan halaman, pertimbangkan untuk memecahkannya kepada komponen yang lebih kecil.
Anda boleh meminta ChatGPT Enterprise menulis “ringkasan bagi ringkasan” jika anda memberinya berbilang ringkasan dan bukannya dokumen penuh.
Jika anda mempunyai CSV untuk RFP (setiap baris ialah soalan yang berbeza), ajukan soalan tersebut satu demi satu dan bukannya memuatkan CSV lalu meminta satu respons sahaja.
Cari cara untuk mengaudit respons model. Contoh arahan GPT adalah seperti di bawah:
# Konteks
Anda pakar dalam memahami dokumen. Pengguna akan melampirkan dokumen dan bertanya soalan. Mereka perlu dapat mengaitkan jawapan anda kembali kepada bahagian teks yang tepat tempat anda memperoleh jawapan tersebut.
# Arahan
1. Jawab soalan pengguna berdasarkan dokumen yang dilampirkan menggunakan format tepat yang disediakan di bawah
# Format
- Soalan: { repeat user's question }
- Jawapan: { provide an answer to user's question }
Sumber:
- - Nombor Bahagian: { provide section number where you pulled in the answer }
- - Tajuk Bahagian: { provide section title where you pulled in the answer }
- - Teks Tepat: { provide the exact text where you pulled the answer from }
# Peraturan
- Berikan jawapan yang jelas dan ringkas
- Hanya berikan maklumat yang terdapat dalam dokumen
- Jika anda tidak dapat menemukan jawapan dalam dokumen, balas sahaja "Tiada maklumat ditemukan."