ChatGPT Enterprise енді көмексөздерге қосылған PDF файлдарына ендірілген визуалдарды (кескіндер, графиктер, диаграммалар және т.б.) оқуды және түсінуді қолдайды. Пайдаланушылар PDF жүктеп сала алады, ал ChatGPT сол файлдағы мәтінді және кез келген визуал элементтерді түсіндіре алады.
Толығырақ PDF файлдарымен визуалды іздеу туралы ЖҚС бөлімін қараңыз.
ChatGPT Enterprise файлдарды бірнеше жолмен жүктеп салуға мүмкіндік береді:
Тікелей компьютеріңізден
GPT білімі ретінде
Жоба файлы ретінде
Бұл нұсқаулық ChatGPT Enterprise мүмкіндіктерінің файлдарды түріне, санына және өлшеміне қарай қалай өңдейтінін түсіндіріп, файл талаптарына сай нәтижелерді жақсарту стратегияларын қарастырады.
Қысқаша шолу
ChatGPT Enterprise әртүрлі файл түрлерін әрқалай өңдейді: PDF, презентация және Word файлдары сияқты мәтіндік құжаттардан мәтін шығарады, электрондық кестелердегі құрылымдалған деректерді Python коды арқылы талдайды және кескін файлдарын GPT-Vision көмегімен сипаттайды. Қай файл түрі қандай жұмыс процесін іске қосатынын түсіну — күтілетін нәтижеге жетудің негізгі шарты.
Мәтіндік құжаттар үшін ChatGPT Enterprise көмексөздің жанына мүмкіндігінше көбірек қатысты мәтінді тікелей қосып, қосымша ақпаратқа қол жеткізу үшін іздеу жүйесін пайдаланады. Бұл нақты сұрақтарға жауап беруде жақсы нәтиже береді. Алайда өте үлкен құжаттарды қорытындылау немесе бірнеше үлкен файлды салыстыру сияқты күрделі тапсырмаларда бұл тәсіл тиімсіз болуы мүмкін. Нәтижелерді жақсарту стратегиялары туралы әрі қарай оқыңыз.
Файлдарды түріне қарай өңдеу
ChatGPT Enterprise файлдарды үш негізгі жолмен өңдейді: мәтінді шығару, кодпен талдау және кескінді түсіндіру. ChatGPT Enterprise қолданатын жұмыс процесін файл түрі анықтайды.
| Мәтінге негізделген іздеу | Код интерпретаторы | Кескіндерді өңдеу | Визуалды іздеу | |
|---|---|---|---|---|
| Файл түрлерінің мысалдары | pptx, docx, txt, md, json, xml, pdf* * GPT білімі немесе Жоба файлдары ретінде жүктеп салынған PDF файлдары | csv, xls, xlsx* *Ескертпе: Код интерпретаторы кез келген файл түрімен жұмыс істей алады, бірақ ChatGPT Enterprise электрондық кестелер үшін әдетте әдепкі бойынша CI құралын қолданады | jpg, png | pdf* * Пайдаланушы көмексөздеріне қосылған PDF файлдары |
| Жұмыс тәртібі | Файлдан мәтінді шығарады: мәтіннің бір бөлігі мәнмәтін терезесіне тікелей кірістіріледі («толтырылады»), ал қалған бөлігі іздеу үшін сақталады | Код интерпретаторы файлды өңдеу үшін Python ортасына жібереді | Кескіндерді көпмодальды модельдер белгілі шектеулерді ескере отырып, тікелей түсіндіреді. | Мәтінді іздеу мен кескінді өңдеудің үйлесімі. Мәтін цифрлық түрде шығарылады, ал визуалды мазмұнды көпмодальды модельдер тікелей түсіндіреді. |
Тек мәтіннен тұратын файлдар, кескін файлдары немесе анық құрылымдалған деректер файлдары (мысалы, транзакциялар берілген Excel кестесі) үшін осылай өңдеу — ең қолайлы тәсіл.
Дегенмен, кейбір жағдайлар соншалықты айқын емес. Мысалы:
PDF файлдарынан басқа файлдарға ендірілген кескіндер өңделмейді. Оларды қосу үшін файлды жүктеп салмас бұрын PDF форматына түрлендіріңіз.
Құжатта мәтін көлемі көп болса да, ChatGPT Enterprise электрондық кестелермен жұмыс істеу үшін әрқашан Код интерпретаторы құралын пайдаланады. Мысалы, ChatGPT Enterprise жүйесінен 10 жол мәтіні бар CSV файлын аударуды сұрасаңыз, ол файлды Python кітапханасы арқылы аударуға тырысады. Бұл модельдің аударманы тікелей жасауына қарағанда дәлдігі төмен әдіс. Бұған жол бермеу үшін электрондық кестені мәтіндік форматқа, мысалы PDF форматына, экспорттап көріңіз.
Сол сияқты, құрылымдалған транзакциялар кестесі бар JSON файлын жүктеп салсаңыз, ChatGPT Enterprise оны кәдімгі мәтін ретінде түсіндіреді. JSON файлындағы деректерді талдағыңыз келсе, көмексөзіңізде модельге Код интерпретаторы құралын пайдалануды тапсырыңыз.
Файлдарды өлшеміне қарай өңдеу
ChatGPT Enterprise ең көбі 128k токендік мәнмәтін терезесі бар модельдерді пайдаланады (шамамен 200 бет мәтін). Алайда жүктеп салынған файлдардағы мәтінді қосу үшін барлық токендер пайдаланылмайды. «Толтырылған» токендер саны пайдалану түріне қарай өзгереді.
ChatGPT Enterprise мәтіннің белгілі бір көлемін «толтырады», ал қалған мәтін жеке іздеу индексіне жіберіледі («векторлық қойма» — үлкен көлемдегі мәтінді тиімді сақтауға және алуға арналған дерекқор түрі). Сұрақ қойғаныңызда, ChatGPT Enterprise қосылған мәтінді жеке іздеу индексінен алынған сәйкес бөліктермен бірге енгізеді.
Бір құжат жүктеп салсаңыз, ChatGPT Enterprise мәтінді басынан бастап, өз шегіне жеткенше қосады. Бірнеше құжат жүктеп салсаңыз, ChatGPT Enterprise әр құжаттың бір бөлігін немесе барлығын қосады. Құжаттардағы барлық мәтін жеке іздеу индексіне де жіберіледі.
Мәтіндік құжаттар үшін мәнмәтінді толтыру
Бұл мүмкіндік белсенді түрде әзірленіп жатыр. Сондықтан төмендегі мәліметтер ескертусіз өзгеруі мүмкін.
ChatGPT Enterprise жүктеп салынған құжаттардан мәнмәтін терезесінде 110k токенге дейін өңдей алады. Жалпы көлемі 110k токеннен аз бір немесе бірнеше құжат жүктеп салсаңыз, толық мазмұн қосылады.
110k токеннен асатын бір құжат үшін тек алғашқы 110k токен басынан бастап қосылады. Қалған бөлігі тек жеке іздеу индексіне жіберіледі.
Бірнеше құжат жүктеп салынып, олардың жалпы көлемі 110k токеннен асса, ChatGPT Enterprise құжаттардың ұсынылуын теңгеру үшін екі қадамдық процесті қолданады:
Жүктеп салынған құжаттар арасында теңдей бөлінген 55k токенге дейін шығарып алады.
Бірінші қадамда толық қамтылмаған құжаттар үшін қалған 55k токенді әр құжатта қалған токендерге қарай пропорционалды түрде бөледі.
Қалған барлық токендер тек жеке іздеу индексіне жіберіледі.
Мәтіндік құжаттағы токендер санын құжат мәтінін OpenAI Tokenizer ішіне көшіру арқылы бағалауға болады.
Мультимедиалық PDF файлдары үшін мәнмәтінді толтыру
Пайдаланушылар мәтін де, кескіндер де бар PDF файлдарын жүктеп салғанда, Визуалды іздеу ChatGPT-ге бұл кескіндерді цифрлық түрде алынған мәтінмен қатар табиғи түрде өңдеуге мүмкіндік береді. Келесі қадамдар мультимедиалық PDF файлдарына арналған стандартты мәнмәтін өңдеу процедураларымызды толықтырады:
Кескіндерді шығару және ендіру: Кескіндер олармен байланысты цифрлық мәтінмен бірге шығарылады және ендіріледі.
Зияткерлік масштабтау: Кескіндер ақпарат сапасы мен қолжетімді мәнмәтін терезесін тиімді пайдалану арасындағы тепе-теңдікті сақтау үшін автоматты түрде масштабталады.
Жүктеп салынған PDF файлдары 110k токен шегінен асқанда, кескіндер де, мәтін де жеке іздеу индексіне ендіріледі. Мәтін ендірмелері сәйкес кескіндерге сілтеме жасайды, бұл ChatGPT-ге пайдаланушы сұрауларына қарай тиісті мәтін-кескін жұптарын алуға мүмкіндік береді. Алынған кескіндер кейін ChatGPT-нің табиғи мультимодальды мүмкіндіктері арқылы өңделеді.
Мультимедиалық PDF файлдары үшін токен қажеттіліктерін дәл бағалау қиын. Сынақтар мәтін мен кескіндер аралас шамамен 350 бет 110k токендік мәнмәтін терезесін толық пайдаланатынын көрсетеді.
Модель түріне негізделген іздеу стратегиялары
GPT сериялы да, o сериялы да модельдер файл жүктеп салуды қолдайды және бірдей мәнмәтін толтыру мен іздеу ендірмелері логикасын пайдаланады. Барлық модельдер кілтсөздік және семантикалық әдістерді біріктіріп, жеке іздеу индексінде гибридті іздеулер орындайды. Гибридті іздеуде модель пайдаланушы көмексөзіне негізделген іздеу тіркесін жасайды, ал жеке іздеу индексі сәйкес мәтін мен кескіндерді алады.
Алайда бұл модельдер мәнмәтін терезесінен асатын үлкен құжаттарды іздеу тәсілі бойынша ерекшеленеді:
GPT сериялы модельдер
Әр көмексөзге бір іздеу: GPT сериялы модельдер пайдаланушының әр көмексөзі үшін бір іздеу орындайды.
Тиімді қолдану жағдайлары: Ауқымды құжаттамадағы қарапайым сұрақтарға жауап беруге өте қолайлы.
Сұрау мысалдары:
"Мерзімінен бұрын зейнетке шығу жөніндегі кадр саясаты қандай?"
"process_order функциясы не істейді?"
o сериялы модельдер
Әр көмексөзге бірнеше іздеу: Пайдаланушының әр көмексөзі үшін бірегей іздеу тіркестерімен бірнеше іздеуді (әдетте 2–3) орындай алады. Іздеулер ретімен орындалады және модель алдыңғы іздеулерден алынған ақпарат негізінде тәсілін өзгерте алады.
Тиімді қолдану жағдайлары: Ауқымды құжаттамада бірнеше нысаналы іздеуді қажет ететін күрделі сұрақтарға қолайлырақ.
Сұрау мысалдары:
"Мерзімінен бұрын зейнетке шығу, бала күтіміне байланысты демалыс және шетелге ауысу жөніндегі кадр саясаты қандай?"
"process_order функциясының не істейтінін түсіндіріп, ол шақыратын барлық әдісті тізімдеңіз және әрқайсысын қысқаша сипаттаңыз."
Артықшылықтарына қарамастан, сұрау үштен көп іздеуді қажет етсе, o сериялы модельдер қиналуы мүмкін.
Файлдарды іздеу нәтижелерін жақсарту кеңестері
Бірнеше іздеуді қажет ететін күрделі сұрақтар үшін o сериялы модельді қолданып көріңіз.
Жүктеп салатын құжаттардың түріне, санына және өлшеміне қарай жауаптар өзгеруі мүмкін екенін есте сақтаңыз.
Әдетте, аз әрі нақты бағытталған құжаттарды жүктеу дәлдікті арттырады.
Көп сұрақты тақырыптарды жеке сұрақтарға айналдырыңыз:
Әр штаттың HR саясаттарын білу қажет болса, оларды бір-бірлеп сұраңыз.
Көп құжатты қорытындылау қажет болса, бір уақытта бір құжат бойынша сұраңыз. Егер ол құжат бірнеше жүз беттен тұрса, оны шағын бөліктерге бөлуді қарастырыңыз.
Толық құжаттардың орнына бірнеше қорытынды берсеңіз, ChatGPT Enterprise-тен «қорытындылардың қорытындысын» жазуды сұрай аласыз.
Егер сізде RFP CSV файлы болса (әр жол — бөлек сұрақ), CSV файлын жай жүктеп, бір жауап сұраудың орнына, сол сұрақтарды бір-бірлеп қойыңыз.
Модель жауаптарын тексеру жолдарын табыңыз. GPT нұсқауларының мысалдары төменде берілген:
# Контекст
Сіз құжаттарды түсінудің сарапшысыз. Пайдаланушы құжатты тіркеп, сұрақ қояды. Олар сіздің жауабыңызды жауап алынған мәтіннің нақты бөлігімен байланыстыра алуы керек.
# Нұсқаулар
1. Пайдаланушының сұрағына қоса тіркелген құжат негізінде төменде берілген нақты форматпен жауап беріңіз
# Формат
- Сұрақ: { пайдаланушының сұрағын қайталаңыз }
- Жауап: { пайдаланушы сұрағына жауап беріңіз }
Дереккөз:
- - Бөлім нөмірі: { жауапты қай бөлімнен алғаныңызды көрсетіңіз }
- - Бөлім атауы: { жауапты қай бөлімнен алғаныңызды көрсетіңіз }
- - Нақты мәтін: { жауапты алған нақты мәтінді беріңіз }
# Ережелер
- Жауаптар анық әрі қысқа болсын
- Тек құжатта берілген ақпаратты ұсыныңыз
- Егер құжаттан жауап таба алмасаңыз, жай ғана «Ақпарат табылмады.» деп жауап беріңіз