ChatGPT Enterprise вече поддържа четене и разбиране на визуални елементи (изображения, графики, диаграми и др.), вградени в PDF файлове, включени в подканите. Потребителите могат да качат PDF файл и ChatGPT може да интерпретира текста и всички визуални елементи в този файл.
За подробности вижте ЧЗВ за Visual Retrieval с PDF файлове.
ChatGPT Enterprise ви позволява да качвате файлове по няколко начина:
Директно от компютъра ви
Като знания за GPT
Като файл на проект
Това ръководство обяснява как функциите на ChatGPT Enterprise обработват файловете според техния тип, брой и размер и разглежда стратегии за подобряване на резултатите в зависимост от изискванията към файловете.
Обобщение
ChatGPT Enterprise обработва различните типове файлове по много различен начин: извлича текст от текстови документи като PDF файлове, презентации и файлове на Word, анализира структурирани данни от електронни таблици чрез код на Python и описва изображения чрез GPT-Vision. За да получите очаквания резултат, е важно да разбирате кой тип файл какъв работен процес задейства.
При текстови документи ChatGPT Enterprise включва възможно най-много подходящ текст непосредствено до подканата и използва система за търсене, за да получи достъп до допълнителна информация. Този подход е ефективен за отговаряне на конкретни въпроси. Той обаче може да изпитва затруднения със сложни задачи, като обобщаване на много големи документи или сравняване на няколко големи файла. Прочетете нататък, за да научите как да подобрите резултатите си.
Обработка на файловете според типа им
ChatGPT Enterprise обработва файловете по три основни начина: извличане на текст, анализ чрез код и интерпретиране на изображения. Типът на файла определя кой работен процес ще следва ChatGPT Enterprise.
| Извличане от текст | Интерпретатор на кодове | Обработка на изображения | Визуално извличане | |
|---|---|---|---|---|
| Примери за типове файлове | pptx, docx, txt, md, json, xml, pdf* * PDF файлове, качени като знания за GPT или файлове на проект | csv, xls, xlsx* *Забележка: Интерпретаторът на кодове може да работи с всеки тип файл, но за електронни таблици ChatGPT Enterprise най-често използва по подразбиране Интерпретатора на кодове | jpg, png | pdf* * PDF файлове, включени в потребителски подкани |
| Поведение | Извлича текста от файла — част от него се поставя („вмъква“) директно в контекстния прозорец, а друга част се съхранява за търсене | Интерпретаторът на кодове предава файла на Python за обработка | Изображенията се интерпретират директно от мултимодални модели при спазване на известните ограничения . | Съчетание от извличане на текст и обработка на изображения. Текстът се извлича цифрово, а визуалното съдържание се интерпретира директно от мултимодални модели. |
При файлове само с текст, файлове с изображения или файлове с ясно структурирани данни (например таблица на Excel с транзакции) това разделение осигурява възможно най-доброто поведение.
Има и някои не толкова очевидни гранични случаи, например:
Изображенията, вградени във файлове, различни от PDF, не се обработват. За да ги включите, преобразувайте файла в PDF, преди да го качите.
ChatGPT Enterprise винаги използва Интерпретатора на кодове за работа с електронни таблици, дори ако документът съдържа голямо количество текст. Например, ако поискате от ChatGPT Enterprise да преведе CSV файл с 10 реда текст, той ще се опита да преведе файла чрез библиотека на Python, което е по-неточно, отколкото моделът да генерира превода директно. За да избегнете този проблем, опитайте да експортирате електронната таблица в текстов формат (например PDF).
По същия начин, ако качите структурирана таблица с транзакции в JSON файл, ChatGPT Enterprise ще интерпретира файла като обикновен текст. Ако искате да анализирате данните в JSON файл, укажете на модела в подканата си да използва Интерпретатора на кодове.
Обработка на файлове според размера
ChatGPT Enterprise използва модели с максимален контекстен прозорец от 128 хил. токена (приблизително 200 страници текст). Не всички токени обаче се използват за включване на текста от качените файлове. Броят на „включените“ токени варира според типа употреба.
ChatGPT Enterprise „включва“ определено количество текст, а останалият текст се изпраща към частен индекс за търсене („векторно хранилище“, което е тип база данни, предназначена да съхранява и извлича ефективно големи количества текст). Когато зададете въпрос, ChatGPT Enterprise включва добавения текст заедно с релевантни части, извлечени от частен индекс за търсене.
Ако качите един документ, ChatGPT Enterprise включва текст от началото, докато достигне лимита си. Ако качите няколко документа, ChatGPT Enterprise включва част или целия текст от всеки документ. Целият текст от документите също се изпраща към частен индекс за търсене.
Включване в контекста за текстови документи
Тази функция е в процес на активно разработване. Поради това следните подробности подлежат на промяна без предизвестие.
ChatGPT Enterprise може да обработва до 110 хил. токена от качени документи в контекстния прозорец. Ако качите един или повече документи с общ обем под 110 хил. токена, ще бъде включено цялото съдържание.
За един документ, надхвърлящ 110 хил. токена, ще бъдат включени само първите 110 хил. токена, започвайки от началото. Останалата част ще бъде изпратена само към частния индекс за търсене.
Ако са качени няколко документа и общият им обем надхвърля 110 хил. токена, ChatGPT Enterprise използва процес в две стъпки, за да балансира представянето на документите:
Извлича до 55 хил. токена, разпределени равномерно между качените документи.
За документи, които не са напълно представени в първата стъпка, разпределя останалите 55 хил. токена пропорционално въз основа на оставащите токени във всеки документ.
Всички останали токени се изпращат само към частния индекс за търсене.
Можете да оцените броя токени в текстов документ, като копирате текста на документа в токенизатора на OpenAI.
Включване в контекста за мултимедийни PDF файлове
Когато потребителите качват PDF файлове, съдържащи както текст, така и изображения, визуалното извличане позволява на ChatGPT да обработва тези изображения естествено заедно с дигитално извлечения текст. Следните стъпки допълват нашите стандартни процедури за обработка на контекста при мултимедийни PDF файлове:
Извличане и вграждане на изображения: Изображенията се извличат и вграждат заедно със свързания с тях дигитален текст.
Интелигентно мащабиране: Изображенията се мащабират автоматично, за да се поддържа баланс между качеството на информацията и ефективното използване на наличния контекстен прозорец.
Когато качените PDF файлове надхвърлят лимита от 110 хил. токена, както изображенията, така и текстът се вграждат в частния индекс за търсене. Текстовите вграждания препращат към релевантни изображения, което позволява на ChatGPT да извлича подходящите двойки текст–изображение въз основа на потребителските заявки. След това извлечените изображения се обработват чрез вградените мултимодални възможности на ChatGPT.
Точното оценяване на изискванията за токени при мултимедийни PDF файлове е трудно. Тестовете показват, че приблизително 350 страници със смесени текст и изображения ще използват напълно контекстния прозорец от 110 хил. токена.
Стратегии за търсене според типа модел
Както моделите от GPT-серията, така и моделите от o-серията поддържат качване на файлове и използват идентична логика за включване в контекста и вграждания за търсене. Всички модели изпълняват хибридни търсения в частен индекс за търсене, комбинирайки методи с ключови думи и семантични методи. При хибридно търсене моделът генерира фраза за търсене въз основа на подканата на потребителя, а частният индекс за търсене извлича съответните текст и изображения.
Тези модели обаче се различават по начина, по който търсят в големи документи, надхвърлящи контекстния прозорец:
Модели от серията GPT
Едно търсене за всяка подкана: Моделите от серията GPT извършват по едно търсене за всяка потребителска подкана.
Подходящи приложения: Идеални са за отговаряне на ясни и конкретни въпроси, чиито отговори се намират в обширна документация.
Примерни заявки:
„Каква е политиката на отдел „Човешки ресурси“ за ранно пенсиониране?“
„Какво прави функцията process_order?“
Модели от серията o
Няколко търсения за всяка подкана: Могат да извършват няколко търсения (обикновено 2–3) за всяка потребителска подкана, всяко с уникална фраза за търсене. Търсенията се извършват последователно, а моделът може да променя подхода си въз основа на информацията, извлечена при предишните търсения.
Подходящи приложения: По-подходящи са за сложни въпроси, изискващи няколко целеви търсения в обширна документация.
Примерни заявки:
„Какви са политиките на отдел „Човешки ресурси“ за ранно пенсиониране, родителски отпуск и преместване в чужбина?“
„Обяснете какво прави функцията process_order, избройте всички методи, които тя извиква, и опишете накратко всеки от тях.“
Въпреки предимствата си моделите от серията o може да изпитват затруднения, когато една заявка изисква повече от три търсения.
Съвети за подобряване на резултатите от търсенето във файлове
Опитайте да използвате модел от o-серията за сложни въпроси, изискващи множество търсения.
Имайте предвид, че отговорите може да варират според типа, броя и размера на документите, които качвате.
Като цяло зареждането на по-малко на брой, фокусирани документи води до по-висока точност.
Превърнете темите с множество въпроси в отделни въпроси:
Ако трябва да знаете HR политиките на всеки щат, задавайте въпросите един по един.
Ако трябва да обобщите много документи, поискайте по един документ наведнъж. Ако този документ е от много стотици страници, помислете дали да не го разделите на по-малки части.
Можете да помолите ChatGPT Enterprise да напише „обобщение на обобщения“, ако му подадете няколко обобщения вместо цели документи.
Ако имате CSV файл на RFP (всеки ред е различен въпрос), задавайте тези въпроси един по един, вместо просто да заредите CSV файла и да поискате един общ отговор.
Намерете начини да проверявате отговорите на модела. По-долу са дадени примерни инструкции за GPT:
# Контекст
Вие сте експерт в разбирането на документи. Потребителят ще прикачи документ и ще зададе въпрос. Той трябва да може да свърже отговора ви с точната част от текста, от която сте взели отговора си.
# Инструкции
1. Отговорете на въпроса на потребителя въз основа на прикачения документ, като използвате точния формат, предоставен по-долу
# Формат
- Въпрос: { повторете въпроса на потребителя }
- Отговор: { дайте отговор на въпроса на потребителя }
Източник:
- - Номер на раздел: { посочете номера на раздела, от който сте взели отговора }
- - Заглавие на раздел: { посочете заглавието на раздела, от който сте взели отговора }
- - Точен текст: { посочете точния текст, от който сте взели отговора }
# Правила
- Давайте ясни и кратки отговори
- Предоставяйте само информация, дадена в документа
- Ако не можете да намерите отговора в документа, просто отговорете „Не е намерена информация.“