ChatGPT Enterprise тепер підтримує читання й розуміння візуальних матеріалів (зображень, графіків, діаграм тощо), вбудованих у файли PDF, включені до запитів. Користувачі можуть завантажити PDF, і ChatGPT зможе інтерпретувати текст і будь-які візуальні елементи в цьому файлі.
Докладніше див. у FAQ щодо Visual Retrieval з PDF.
ChatGPT Enterprise дає змогу завантажувати файли кількома способами:
Безпосередньо з комп’ютера
Як файл проєкту
З дії GPT
У цьому посібнику пояснюється, як функції ChatGPT Enterprise обробляють файли залежно від їхнього типу, кількості й розміру, а також розглядаються стратегії покращення результатів відповідно до вимог до файлів.
Короткий огляд
ChatGPT Enterprise обробляє різні типи файлів по-різному: видобуває текст із текстових документів, як-от PDF-файли, презентації та файли Word; аналізує структуровані дані з електронних таблиць за допомогою коду Python; описує зображення за допомогою GPT-Vision. Щоб отримати очікуваний результат, важливо розуміти, який робочий процес запускає кожен тип файлу.
Під час роботи з текстовими документами ChatGPT Enterprise додає якомога більше релевантного тексту безпосередньо до запиту, а для доступу до додаткової інформації використовує пошукову систему. Цей підхід добре підходить для відповідей на конкретні запитання. Однак він може бути менш ефективним для складних завдань, як-от узагальнення дуже великих документів або порівняння кількох великих файлів. Читайте далі, щоб дізнатися про стратегії покращення результатів.
Обробка файлів залежно від типу
ChatGPT Enterprise обробляє файли трьома основними способами: видобуває текст, аналізує код та інтерпретує зображення. Саме тип файлу визначає, який робочий процес використовуватиме ChatGPT Enterprise.
| Пошук у тексті | Інтерпретатор коду | Обробка зображень | Візуальний пошук | |
|---|---|---|---|---|
| Приклади типів файлів | pptx, docx, txt, md, json, xml, pdf* * PDF-файли, завантажені як база знань GPT або файли проєкту | csv, xls, xlsx* *Примітка. Інтерпретатор коду може працювати з файлами будь-якого типу, але для електронних таблиць ChatGPT Enterprise найчастіше за замовчуванням використовує CI | jpg, png | pdf* * PDF-файли, додані до запитів користувачів |
| Поведінка | Видобуває текст із файлу: частину тексту вставляє безпосередньо в ліміт контексту, а частину зберігає для пошуку | Інтерпретатор коду передає файл у Python для обробки | Мультимодальні моделі інтерпретують зображення безпосередньо з урахуванням відомих обмежень . | Поєднання пошуку в тексті та обробки зображень. Текст видобувається в цифровому вигляді, а мультимодальні моделі безпосередньо інтерпретують візуальний вміст. |
Для суто текстових файлів, зображень або файлів із чітко структурованими даними (наприклад, таблиці Excel із транзакціями) такий розподіл забезпечує найкращу можливу обробку.
Однак є й менш очевидні неоднозначні випадки, наприклад:
Зображення, вбудовані у файли інших форматів, крім PDF, не обробляються. Щоб додати такі зображення, перед завантаженням перетворіть файл на PDF.
ChatGPT Enterprise завжди використовуватиме інтерпретатор коду для роботи з електронними таблицями, навіть якщо документ містить багато тексту. Наприклад, якщо попросити ChatGPT Enterprise перекласти CSV-файл із 10 рядками тексту, система спробує перекласти файл за допомогою бібліотеки Python. Це менш точно, ніж переклад, згенерований безпосередньо моделлю. Щоб уникнути цієї проблеми, спробуйте експортувати електронну таблицю в текстовий формат, наприклад PDF.
Так само, якщо завантажити структуровану таблицю транзакцій у файлі JSON, ChatGPT Enterprise інтерпретуватиме цей файл як звичайний текст. Якщо потрібно проаналізувати дані у файлі JSON, у запиті дайте моделі вказівку використати інтерпретатор коду.
Обробка файлів залежно від розміру
ChatGPT Enterprise використовує моделі з максимальним лімітом контексту 128 тис. токенів (приблизно 200 сторінок тексту). Однак не всі токени використовуються для включення тексту із завантажених файлів. Кількість «вставлених» токенів залежить від типу використання.
ChatGPT Enterprise «вставляє» певний обсяг тексту, а решта тексту надсилається до приватного пошукового індексу («векторного сховища» — типу бази даних, призначеного для ефективного зберігання й отримання великих обсягів тексту). Коли ви ставите запитання, ChatGPT Enterprise додає включений текст разом із релевантними фрагментами, отриманими з приватного пошукового індексу.
Якщо ви завантажуєте один документ, ChatGPT Enterprise включає текст від початку, доки не досягне свого ліміту. Якщо ви завантажуєте кілька документів, ChatGPT Enterprise включає частину або весь текст кожного документа. Увесь текст із документів також надсилається до приватного пошукового індексу.
Наповнення контексту для текстових документів
Ця функція перебуває в активній розробці. Тому наведені нижче деталі можуть змінюватися без попередження.
ChatGPT Enterprise може обробляти до 110 тис. токенів із завантажених документів у ліміті контексту. Якщо ви завантажите один або кілька документів із сумарним обсягом менш ніж 110 тис. токенів, буде включено весь вміст.
Для одного документа, що перевищує 110 тис. токенів, буде включено лише перші 110 тис. токенів, починаючи з початку. Решту буде надіслано лише до приватного пошукового індексу.
Якщо завантажено кілька документів і їхній сумарний обсяг перевищує 110 тис. токенів, ChatGPT Enterprise використовує двоетапний процес, щоб збалансувати представлення документів:
Видобути до 55 тис. токенів, розподілених порівну між завантаженими документами.
Для документів, які не повністю представлені на першому кроці, розподілити решту 55 тис. токенів пропорційно до кількості токенів, що залишилися в кожному документі.
Усі решта токенів надсилаються лише до приватного пошукового індексу.
Ви можете оцінити кількість токенів у текстовому документі, скопіювавши текст документа в OpenAI Tokenizer.
Наповнення контексту для мультимедійних PDF
Коли користувачі завантажують PDF-файли, що містять і текст, і зображення, Visual Retrieval дає ChatGPT змогу обробляти ці зображення нативно разом із цифрово витягнутим текстом. Наведені нижче кроки доповнюють наші стандартні процедури обробки контексту для мультимедійних PDF:
Видобування та вбудовування зображень: зображення видобуваються та вбудовуються разом із пов’язаним із ними цифровим текстом.
Інтелектуальне масштабування: зображення автоматично масштабуються, щоб підтримувати баланс між якістю інформації та ефективним використанням доступного ліміту контексту.
Коли завантажені PDF перевищують ліміт у 110 тис. токенів, і зображення, і текст вбудовуються в приватний пошуковий індекс. Текстові вбудовування посилаються на релевантні зображення, що дає ChatGPT змогу отримувати відповідні пари тексту й зображення на основі запитів користувачів. Отримані зображення потім обробляються за допомогою нативних мультимодальних можливостей ChatGPT.
Точно оцінити потреби в токенах для мультимедійних PDF складно. Тестування показує, що приблизно 350 сторінок змішаного тексту й зображень повністю використають ліміт контексту в 110 тис. токенів.
Стратегії пошуку залежно від типу моделі
Моделі серії GPT і серії o підтримують завантаження файлів і використовують однакову логіку наповнення контексту та пошукових вбудовувань. Усі моделі виконують гібридний пошук у приватному пошуковому індексі, поєднуючи ключові слова й семантичні методи. Під час гібридного пошуку модель генерує пошукову фразу на основі запиту користувача, а приватний пошуковий індекс відповідно отримує релевантний текст і зображення.
Однак ці моделі відрізняються тим, як вони здійснюють пошук у великих документах, що перевищують ліміт контексту:
Моделі серії GPT
Один пошук на запит: моделі серії GPT виконують один пошук для кожного запиту користувача.
Оптимальні сценарії використання: ідеально підходять для відповідей на прості запитання, інформація про які міститься у великому обсязі документації.
Приклади запитів:
«Яка кадрова політика застосовується до дострокового виходу на пенсію?»
«Що робить функція process_order?»
Моделі серії o
Кілька пошуків на один запит: можуть виконувати кілька пошуків (зазвичай 2–3) на кожен запит користувача, використовуючи для кожного окрему пошукову фразу. Пошуки виконуються послідовно, і модель може коригувати свій підхід на основі інформації, отриманої під час попередніх пошуків.
Оптимальні сценарії використання: краще підходять для складних запитань, що потребують кількох цільових пошуків у великому обсязі документації.
Приклади запитів:
«Які кадрові політики застосовуються до дострокового виходу на пенсію, відпустки для догляду за дитиною та переведення за кордон?»
«Поясни, що робить функція process_order, переліч усі методи, які вона викликає, і стисло опиши кожен із них».
Попри свої переваги, моделі серії o можуть мати труднощі із запитами, для яких потрібно понад три пошуки.
Поради щодо покращення результатів пошуку у файлах
Спробуйте використовувати модель серії o для складних запитань, що потребують кількох пошуків.
Пам’ятайте, що відповіді можуть відрізнятися залежно від типу, кількості та розміру документів, які ви завантажуєте.
Загалом завантаження меншої кількості цільових документів підвищує точність.
Перетворюйте теми з кількома запитаннями на окремі запитання:
Якщо вам потрібно дізнатися HR-політики кожного штату, запитуйте їх по черзі.
Якщо вам потрібно підсумувати багато документів, просіть опрацьовувати один документ за раз. Якщо цей документ має багато сотень сторінок, подумайте про те, щоб розбити його на менші частини.
Ви можете попросити ChatGPT Enterprise написати «підсумок підсумків», якщо надасте йому кілька підсумків замість цілих документів.
Якщо у вас є CSV з RFP (кожен рядок — окреме запитання), ставте ці запитання по черзі, а не просто завантажуйте CSV і просіть одну відповідь.
Знайдіть способи перевіряти відповіді моделі. Нижче наведено приклади інструкцій для GPT:
# Контекст
Ви є експертом у розумінні документів. Користувач збирається прикріпити документ і поставити запитання. Йому потрібно мати змогу пов’язати вашу відповідь із точною частиною тексту, звідки ви взяли відповідь.
# Інструкції
1. Дайте відповідь на запитання користувача на основі прикріпленого документа, використовуючи точний формат, наведений нижче
# Формат
- Запитання: { повторіть запитання користувача }
- Відповідь: { надайте відповідь на запитання користувача }
Джерело:
- - Номер розділу: { вкажіть номер розділу, звідки ви взяли відповідь }
- - Назва розділу: { вкажіть назву розділу, звідки ви взяли відповідь }
- - Точний текст: { наведіть точний текст, звідки ви взяли відповідь }
# Правила
- Надавайте чіткі й лаконічні відповіді
- Надавайте лише інформацію, що міститься в документі
- Якщо ви не можете знайти відповідь у документі, просто відповідайте «Інформацію не знайдено.»