OpenAI
Ova je stranica strojno prevedena. Pogledajte izvorni članak na engleskom jeziku.

Optimizacija prijenosa datoteka u ChatGPT Enterprise

Saznajte kako značajke ChatGPT Enterprise obrađuju datoteke prema vrsti, broju i veličini. Poboljšajte rezultate prema zahtjevima datoteka.

Ažurirano: 2 days ago

ChatGPT Enterprise sada podržava čitanje i razumijevanje vizuala (slika, grafikona, dijagrama itd.) ugrađenih u PDF datoteke uključene u upite. Korisnici mogu prenijeti PDF, a ChatGPT može protumačiti tekst i sve vizualne elemente unutar te datoteke.

Pojedinosti potražite u Čestim pitanjima o vizualnom dohvaćanju s PDF-ovima.

ChatGPT Enterprise omogućuje prijenos datoteka na nekoliko načina:

Ovaj vodič objašnjava kako značajke usluge ChatGPT Enterprise obrađuju datoteke ovisno o njihovoj vrsti, broju i veličini te opisuje strategije za poboljšanje rezultata prema zahtjevima datoteka.

Sažetak

ChatGPT Enterprise različite vrste datoteka obrađuje na vrlo različite načine: iz tekstnih dokumenata kao što su PDF-ovi, prezentacije i Wordove datoteke izdvaja tekst, strukturirane podatke iz proračunskih tablica analizira pomoću Pythonova koda, a slikovne datoteke opisuje putem značajke GPT-Vision. Da biste dobili očekivani rezultat, ključno je razumjeti koja vrsta datoteke pokreće koji tijek rada.

Za tekstne dokumente ChatGPT Enterprise uz upit izravno uključuje što više relevantnog teksta, a za pristup dodatnim informacijama upotrebljava sustav pretraživanja. To dobro funkcionira pri odgovaranju na konkretna pitanja. Međutim, ovaj pristup može imati poteškoća sa složenim zadacima kao što su sažimanje vrlo velikih dokumenata ili usporedba više velikih datoteka. U nastavku saznajte koje strategije mogu poboljšati vaše rezultate.

Obrada datoteka prema vrsti

ChatGPT Enterprise obrađuje datoteke na tri glavna načina: izdvajanjem teksta, analizom koda i tumačenjem slika. Vrsta datoteke određuje koji će tijek rada ChatGPT Enterprise primijeniti.

Dohvaćanje na temelju tekstaInterpreter kodaObrada slikaVizualno dohvaćanje
Primjeri vrsta datotekapptx, docx, txt, md, json, xml, pdf*
* PDF-ovi preneseni kao

znanje GPT-a
ili

projektne datoteke
csv, xls, xlsx*
*Napomena: Interpreter koda može raditi sa svim vrstama datoteka, ali ChatGPT Enterprise za proračunske tablice najčešće prema zadanim postavkama upotrebljava Interpreter koda
jpg, pngpdf*
* PDF-ovi uključeni u korisničke upite
Način radaIzdvaja tekst iz datoteke – dio teksta umeće se izravno u kontekstni prozor, a dio se pohranjuje za pretraživanjeInterpreter koda prosljeđuje datoteku Pythonu na obraduMultimodalni modeli izravno tumače slike, uz

poznata ograničenja
.
Kombinacija dohvaćanja teksta i obrade slika. Tekst se digitalno izdvaja, a multimodalni modeli izravno tumače vizualni sadržaj.

Za datoteke koje sadrže samo tekst, slikovne datoteke ili jasno strukturirane podatkovne datoteke (npr. Excelovu tablicu transakcija) ove podjele predstavljaju najbolji mogući način obrade.

Postoje i neki manje očiti nejasni slučajevi, primjerice:

  • Slike ugrađene u datoteke koje nisu PDF-ovi ne obrađuju se. Da biste ih uključili, prije prijenosa pretvorite datoteku u PDF.

  • ChatGPT Enterprise uvijek će upotrebljavati Interpreter koda za rad s proračunskim tablicama, čak i ako dokument sadrži mnogo teksta. Primjerice, ako od usluge ChatGPT Enterprise zatražite da prevede CSV datoteku s 10 redaka teksta, pokušat će je prevesti pomoću Pythonove biblioteke, što je manje precizno nego kada model izravno generira prijevod. Kako biste ublažili taj problem, pokušajte izvesti proračunsku tablicu u tekstni format, primjerice PDF.

  • Isto tako, ako prenesete strukturiranu tablicu transakcija u JSON datoteci, ChatGPT Enterprise protumačit će tu datoteku kao običan tekst. Ako želite analizirati podatke iz JSON datoteke, u upitu naložite modelu da upotrijebi Interpreter koda.

Rukovanje datotekama na temelju veličine

ChatGPT Enterprise upotrebljava modele s maksimalnim kontekstnim prozorom od 128 tisuća tokena (otprilike 200 stranica teksta). Međutim, ne upotrebljavaju se svi tokeni za uključivanje teksta iz prenesenih datoteka. Broj „umetnutih” tokena razlikuje se ovisno o vrsti upotrebe.

ChatGPT Enterprise „umeće” određenu količinu teksta, a preostali tekst šalje se u privatni indeks pretraživanja („vektorska pohrana”, vrsta baze podataka osmišljena za učinkovitu pohranu i dohvaćanje velikih količina teksta). Kada postavite pitanje, ChatGPT Enterprise uključuje uvršteni tekst zajedno s relevantnim isječcima dohvaćenima iz privatnog indeksa pretraživanja.

Ako prenesete jedan dokument, ChatGPT Enterprise uključuje tekst od početka dok ne dosegne svoje ograničenje. Ako prenesete više dokumenata, ChatGPT Enterprise uključuje dio ili sav sadržaj svakog dokumenta. Sav tekst iz dokumenata također se šalje u privatni indeks pretraživanja.

Umetanje konteksta za tekstne dokumente

Ta je značajka u aktivnom razvoju. Stoga su sljedeće pojedinosti podložne promjenama bez prethodne obavijesti.

ChatGPT Enterprise može obraditi do 110 tisuća tokena iz prenesenih dokumenata u kontekstnom prozoru. Ako prenesete jedan ili više dokumenata s ukupno manje od 110 tisuća tokena, bit će uključen cijeli sadržaj.

Za jedan dokument koji premašuje 110 tisuća tokena bit će uključeno samo prvih 110 tisuća tokena, počevši od početka. Ostatak će se poslati samo u privatni indeks pretraživanja.

Ako je preneseno više dokumenata i njihov ukupan broj premašuje 110 tisuća tokena, ChatGPT Enterprise upotrebljava postupak u dva koraka za uravnoteženu zastupljenost dokumenata:

  1. Izdvojite do 55 tisuća tokena, podijeljenih ravnomjerno među prenesenim dokumentima.

  1. Za dokumente koji nisu u potpunosti zastupljeni u prvom koraku dodijelite preostalih 55 tisuća tokena proporcionalno na temelju tokena preostalih u svakom dokumentu.

  1. Svi preostali tokeni šalju se samo u privatni indeks pretraživanja.

Broj tokena u tekstnom dokumentu možete procijeniti kopiranjem teksta dokumenta u OpenAI Tokenizer.

Umetanje konteksta za multimedijske PDF-ove

Kada korisnici prenesu PDF-ove koji sadrže i tekst i slike, Vizualno dohvaćanje omogućuje ChatGPT-u izvornu obradu tih slika zajedno s digitalno izdvojenim tekstom. Sljedeći koraci nadopunjuju naše standardne postupke za rukovanje kontekstom za multimedijske PDF-ove:

  • Izdvajanje i ugrađivanje slika: Slike se izdvajaju i ugrađuju zajedno s povezanim digitalnim tekstom.

  • Inteligentno skaliranje: Slike se automatski skaliraju radi održavanja ravnoteže između kvalitete informacija i učinkovite upotrebe dostupnog kontekstnog prozora.

Kada preneseni PDF-ovi premašuju ograničenje od 110 tisuća tokena, i slike i tekst ugrađuju se u privatni indeks pretraživanja. Tekstne ugradnje upućuju na relevantne slike, što ChatGPT-u omogućuje dohvaćanje odgovarajućih parova teksta i slike na temelju korisničkih upita. Dohvaćene slike zatim se obrađuju pomoću izvornih multimodalnih mogućnosti ChatGPT-a.

Točna procjena potreba za tokenima za multimedijske PDF-ove zahtjevna je. Testiranja pokazuju da će otprilike 350 stranica mješovitog teksta i slika u potpunosti iskoristiti kontekstni prozor od 110 tisuća tokena.

Strategije pretraživanja na temelju vrste modela

Modeli serije GPT i serije o podržavaju prijenos datoteka te upotrebljavaju istu logiku umetanja konteksta i ugradnji za pretraživanje. Svi modeli izvršavaju hibridna pretraživanja privatnog indeksa pretraživanja, kombinirajući metode temeljene na ključnim riječima i semantičke metode. U hibridnom pretraživanju model generira frazu za pretraživanje na temelju korisnikova upita, a privatni indeks pretraživanja prema tome dohvaća relevantan tekst i slike.

Međutim, ti se modeli razlikuju po načinu pretraživanja velikih dokumenata koji premašuju kontekstni prozor:

modeli serije GPT

  • Jedno pretraživanje po upitu: Modeli serije GPT izvršavaju jedno pretraživanje za svaki korisnički upit.

  • Prikladni slučajevi upotrebe: Idealni su za odgovaranje na jednostavna pitanja čiji se odgovori nalaze u opsežnoj dokumentaciji.

Primjeri upita:

  • „Koja su pravila odjela ljudskih resursa o prijevremenom umirovljenju?”

  • „Što radi funkcija process_order?”

modeli serije o

  • Više pretraživanja po upitu: Za svaki korisnički upit može izvršiti više pretraživanja (obično 2 – 3), svako s jedinstvenim izrazom za pretraživanje. Pretraživanja se izvršavaju redom, a model može prilagoditi pristup na temelju informacija dohvaćenih prethodnim pretraživanjima.

  • Prikladni slučajevi upotrebe: Prikladniji su za složena pitanja koja zahtijevaju više ciljanih pretraživanja opsežne dokumentacije.

Primjeri upita:

  • „Koja su pravila odjela ljudskih resursa o prijevremenom umirovljenju, roditeljskom dopustu i premještaju u inozemstvo?”

  • „Objasnite što radi funkcija process_order, navedite sve metode koje ta funkcija poziva i ukratko opišite svaku od njih.”

Unatoč svojim prednostima, modeli serije o mogu imati poteškoća s upitima koji zahtijevaju više od tri pretraživanja.

Savjeti za poboljšanje rezultata pretraživanja datoteka

  • Pokušajte upotrijebiti model serije o za složena pitanja koja zahtijevaju više pretraživanja.

  • Imajte na umu da se odgovori mogu razlikovati ovisno o vrsti, broju i veličini dokumenata koje prenesete.

  • Općenito, učitavanje manjeg broja fokusiranih dokumenata dovest će do veće točnosti.

  • Teme s više pitanja pretvorite u pojedinačna pitanja:

    • Ako trebate znati HR pravila svake države, pitajte jedno po jedno.

    • Ako trebate sažeti mnogo dokumenata, tražite jedan po jedan dokument. Ako taj dokument ima više stotina stranica, razmislite o njegovu raščlanjivanju na manje dijelove.

      • Od ChatGPT Enterprisea mogli biste zatražiti da napiše „sažetak sažetaka” ako mu dostavite više sažetaka umjesto cijelih dokumenata.

    • Ako imate CSV RFP-a (svaki je redak drugo pitanje), postavljajte ta pitanja jedno po jedno umjesto da samo učitate CSV i zatražite jedan odgovor.

  • Pronađite načine za provjeru odgovora modela. Primjeri GPT uputa navedeni su u nastavku:

# Kontekst 

Stručnjak ste za razumijevanje dokumenata. Korisnik će priložiti dokument i postaviti pitanje. Mora moći povezati vaš odgovor s točnim dijelom teksta iz kojeg ste preuzeli odgovor.

# Upute

1. Odgovorite na korisnikovo pitanje na temelju priloženog dokumenta točno u nastavku navedenom formatu

# Format

- Pitanje: { ponovite korisnikovo pitanje }
- Odgovor: { pružite odgovor na korisnikovo pitanje }
Izvor:
- - Broj odjeljka: { navedite broj odjeljka iz kojeg ste preuzeli odgovor }
- - Naslov odjeljka: { navedite naslov odjeljka iz kojeg ste preuzeli odgovor }
- - Točan tekst: { navedite točan tekst iz kojeg ste preuzeli odgovor }

# Pravila

- Dajte jasne i sažete odgovore
- Navodite samo informacije iz dokumenta
- Ako ne možete pronaći odgovor u dokumentu, jednostavno odgovorite „Nisu pronađene informacije.”

Je li vam ovaj članak bio koristan?