ChatGPT Enterprise-ն այժմ աջակցում է հարցումներում ներառված PDF ֆայլերում ներկառուցված տեսողական նյութերի (պատկերներ, գրաֆիկներ, դիագրամներ և այլն) ընթերցումն ու ըմբռնումը։ Օգտատերերը կարող են վերբեռնել PDF, և ChatGPT-ն կարող է մեկնաբանել այդ ֆայլի տեքստը և ցանկացած տեսողական տարր։
Մանրամասների համար տես PDF-ների միջոցով տեսողական որոնման ՀՏՀ։
ChatGPT Enterprise-ը թույլ է տալիս ֆայլեր վերբեռնել մի քանի եղանակով․
Ուղղակիորեն ձեր համակարգչից
Որպես GPT գիտելիքներ
Որպես նախագծի ֆայլ
Այս ուղեցույցը բացատրում է, թե ինչպես են ChatGPT Enterprise-ի գործառույթները մշակում ֆայլերը՝ ըստ դրանց տեսակի, քանակի և չափի, և քննարկում է ֆայլերի պահանջներից ելնելով արդյունքները բարելավելու ռազմավարություններ։
Ամփոփում
ChatGPT Enterprise-ը շատ տարբեր կերպ է վերաբերվում տարբեր ֆայլերի տեսակներին․ տեքստ է հանում տեքստային փաստաթղթերից, ինչպիսիք են PDF-ները, ներկայացումները և Word ֆայլերը, աղյուսակներից կառուցվածքային տվյալներ է վերլուծում Python կոդի միջոցով և պատկերային ֆայլերը նկարագրում է GPT-Vision-ի միջոցով։ Հասկանալը, թե որ ֆայլի տեսակն ինչ աշխատանքային հոսք է գործարկում, ակնկալվող արդյունք ստանալու բանալին է։
Տեքստային փաստաթղթերի դեպքում ChatGPT Enterprise-ը հնարավորինս շատ համապատասխան տեքստ է ներառում անմիջապես հարցման կողքին և լրացուցիչ տեղեկություններին հասանելիություն ստանալու համար օգտագործում է որոնման համակարգ։ Սա լավ է աշխատում կոնկրետ հարցերին պատասխանելու համար։ Սակայն այս մոտեցումը կարող է դժվարանալ բարդ առաջադրանքների դեպքում, օրինակ՝ շատ մեծ փաստաթղթեր ամփոփելիս կամ մի քանի մեծ ֆայլեր համեմատելիս։ Կարդացեք շարունակությունը՝ հասկանալու ձեր արդյունքները բարելավելու ռազմավարությունները։
Ֆայլերի մշակումը՝ ըստ տեսակի
ChatGPT Enterprise-ը ֆայլերը մշակում է երեք հիմնական եղանակով՝ տեքստի հանում, կոդի վերլուծություն և պատկերների մեկնաբանություն։ Ֆայլի տեսակը որոշում է, թե որ աշխատանքային հոսքին է հետևում ChatGPT Enterprise-ը։
| Տեքստի վրա հիմնված որոնում | Կոդերի թարգմանիչ | Պատկերների մշակում | Տեսողական որոնում | |
|---|---|---|---|---|
| Ֆայլի տեսակների օրինակներ | pptx, docx, txt, md, json, xml, pdf* * PDF-ներ, որոնք վերբեռնվել են որպես GPT գիտելիքներ կամ նախագծի ֆայլեր | csv, xls, xlsx* *Նշում. Կոդերի թարգմանիչը կարող է աշխատել ցանկացած ֆայլի տեսակի հետ, բայց ChatGPT Enterprise-ը աղյուսակների համար առավել հաճախ լռելյայն օգտագործում է CI | jpg, png | pdf* * Օգտատիրոջ հարցումներում ներառված PDF-ներ |
| Վարքագիծ | Հանում է տեքստը ֆայլից. տեքստի մի մասը տեղադրվում («լցվում») է անմիջապես համատեքստային պատուհանում, իսկ մի մասը պահվում է որոնման համար | Կոդերի թարգմանիչը ֆայլը փոխանցում է Python-ին՝ մշակման համար | Պատկերները բնիկ եղանակով մեկնաբանվում են բազմամոդալ մոդելների կողմից՝ հաշվի առնելով հայտնի սահմանափակումները ։ | Տեքստի որոնման և պատկերների մշակման հիբրիդ։ Տեքստը թվայնորեն հանվում է, իսկ տեսողական բովանդակությունը բնիկ եղանակով մեկնաբանվում է բազմամոդալ մոդելների կողմից։ |
Միայն տեքստային ֆայլերի, պատկերային ֆայլերի կամ հստակ կառուցվածքային տվյալների ֆայլերի (օրինակ՝ գործարքների Excel աղյուսակ) դեպքում այս բաժանումները ներկայացնում են հնարավոր լավագույն վարքագիծը։
Կան որոշ ոչ այնքան ակնհայտ անորոշ դեպքեր, օրինակ՝
PDF-ներից բացի այլ ֆայլերում ներկառուցված պատկերները չեն մշակվում։ Դրանք ներառելու համար ֆայլը վերբեռնելուց առաջ փոխակերպեք PDF-ի։
ChatGPT Enterprise-ը միշտ կօգտագործի Կոդերի թարգմանիչը աղյուսակների հետ աշխատելու համար, նույնիսկ եթե փաստաթուղթը մեծ քանակությամբ տեքստ է պարունակում։ Օրինակ, եթե ChatGPT Enterprise-ին խնդրեք թարգմանել 10 տող տեքստ ունեցող CSV ֆայլ, այն կփորձի ֆայլը թարգմանել Python գրադարանի միջոցով, ինչը պակաս ճշգրիտ է, քան մոդելին ուղղակիորեն թարգմանություն ստեղծելու թույլտվություն տալը։ Դա մեղմելու համար փորձեք աղյուսակը արտահանել տեքստային ձևաչափով (օրինակ՝ PDF)։
Նմանապես, եթե վերբեռնում եք JSON ֆայլում պարունակվող կառուցվածքային գործարքային աղյուսակ, ChatGPT Enterprise-ը այս ֆայլը կմեկնաբանի որպես պարզ տեքստ։ Եթե ցանկանում եք վերլուծել JSON ֆայլում պարունակվող տվյալները, ձեր հարցման մեջ մոդելին հանձնարարեք օգտագործել Կոդերի թարգմանիչը։
Ֆայլերի մշակումը՝ ըստ չափի
ChatGPT Enterprise-ն օգտագործում է մոդելներ, որոնց առավելագույն համատեքստային պատուհանը 128k թոքեն է (մոտավորապես 200 էջ տեքստ)։ Այնուամենայնիվ, ոչ բոլոր թոքեններն են օգտագործվում վերբեռնված ֆայլերից տեքստը ներառելու համար։ «Լցված» թոքենների քանակը տարբերվում է ըստ օգտագործման տեսակի։
ChatGPT Enterprise-ը «լցնում է» որոշակի քանակի տեքստ, իսկ մնացած տեքստն ուղարկվում է մասնավոր որոնման ինդեքս («վեկտորային պահոց», որը տվյալների բազայի տեսակ է՝ նախատեսված մեծ քանակի տեքստ արդյունավետ պահելու և գտնելու համար)։ Երբ հարց եք տալիս, ChatGPT Enterprise-ը ներգրավում է ներառված տեքստը՝ մասնավոր որոնման ինդեքսից ստացված համապատասխան հատվածների հետ միասին։
Եթե վերբեռնում եք մեկ փաստաթուղթ, ChatGPT Enterprise-ը ներառում է տեքստը սկզբից մինչև իր սահմանաչափին հասնելը։ Եթե վերբեռնում եք մի քանի փաստաթուղթ, ChatGPT Enterprise-ը ներառում է յուրաքանչյուր փաստաթղթի մի մասը կամ ամբողջը։ Փաստաթղթերի ամբողջ տեքստը նույնպես ուղարկվում է մասնավոր որոնման ինդեքս։
Համատեքստի լրացում տեքստային փաստաթղթերի համար
Այս գործառույթը ակտիվ մշակման փուլում է։ Հետևաբար, ստորև ներկայացված մանրամասները կարող են փոխվել առանց նախազգուշացման։
ChatGPT Enterprise-ը կարող է վերբեռնված փաստաթղթերից մշակել մինչև 110k թոքեն համատեքստային պատուհանում։ Եթե վերբեռնում եք մեկ կամ մի քանի փաստաթուղթ, որոնց ընդհանուր ծավալը 110k թոքենից պակաս է, ամբողջ բովանդակությունը կներառվի։
110k թոքենը գերազանցող մեկ փաստաթղթի դեպքում կներառվեն միայն առաջին 110k թոքենները՝ սկսած սկզբից։ Մնացած մասը կուղարկվի միայն մասնավոր որոնման ինդեքս։
Եթե վերբեռնվում են մի քանի փաստաթղթեր, և դրանց ընդհանուր ծավալը գերազանցում է 110k թոքենը, ChatGPT Enterprise-ը փաստաթղթերի ներկայացվածությունը հավասարակշռելու համար օգտագործում է երկքայլ գործընթաց․
Հանել մինչև 55k թոքեն՝ հավասարաչափ բաշխված վերբեռնված փաստաթղթերի միջև։
Այն փաստաթղթերի համար, որոնք առաջին քայլում ամբողջությամբ չեն ներկայացվել, մնացած 55k թոքենները բաշխել համամասնորեն՝ ըստ յուրաքանչյուր փաստաթղթում մնացած թոքենների։
Մնացած բոլոր թոքեններն ուղարկվում են միայն մասնավոր որոնման ինդեքս։
Տեքստային փաստաթղթում թոքենների քանակը կարող եք գնահատել՝ փաստաթղթի տեքստը պատճենելով OpenAI Tokenizer-ում։
Համատեքստի լրացում մուլտիմեդիա PDF-ների համար
Երբ օգտատերերը վերբեռնում են թե՛ տեքստ, թե՛ պատկերներ պարունակող PDF-ներ, Տեսողական որոնումը ChatGPT-ին հնարավորություն է տալիս մշակել այս պատկերները բնիկ եղանակով՝ թվայնորեն հանված տեքստի հետ միասին։ Հետևյալ քայլերը լրացնում են մուլտիմեդիա PDF-ների համատեքստի մշակման մեր ստանդարտ ընթացակարգերը․
Պատկերների հանում և ներդրում. Պատկերները հանվում և ներդրվում են իրենց առնչվող թվային տեքստի հետ միասին։
Խելացի մասշտաբավորում. Պատկերները ավտոմատ մասշտաբավորվում են՝ տեղեկատվության որակի և հասանելի համատեքստային պատուհանի արդյունավետ օգտագործման միջև հավասարակշռություն պահելու համար։
Երբ վերբեռնված PDF-ները գերազանցում են 110k թոքենի սահմանաչափը, թե՛ պատկերները, թե՛ տեքստը ներդրվում են մասնավոր որոնման ինդեքսում։ Տեքստային ներդրումները հղում են անում համապատասխան պատկերներին՝ թույլ տալով ChatGPT-ին օգտատիրոջ հարցումների հիման վրա գտնել համապատասխան տեքստ-պատկեր զույգերը։ Այնուհետև գտնված պատկերները մշակվում են ChatGPT-ի բնիկ բազմամոդալ հնարավորություններով։
Մուլտիմեդիա PDF-ների համար թոքենների պահանջները ճշգրիտ գնահատելը դժվար է։ Թեստավորումը ցույց է տալիս, որ խառը տեքստով և պատկերներով մոտ 350 էջը լիովին կօգտագործի 110k թոքենանոց համատեքստային պատուհանը։
Որոնման ռազմավարություններ՝ ըստ մոդելի տեսակի
Թե՛ GPT-շարքի, թե՛ o-շարքի մոդելները աջակցում են ֆայլերի վերբեռնմանը և օգտագործում են համատեքստի լրացման ու որոնման ներդրման նույնական տրամաբանություն։ Բոլոր մոդելները կատարում են հիբրիդային որոնումներ մասնավոր որոնման ինդեքսում՝ համադրելով բանալի բառերի և իմաստային մեթոդները։ Հիբրիդային որոնման ժամանակ մոդելը ստեղծում է որոնման արտահայտություն՝ հիմնվելով օգտատիրոջ հարցման վրա, իսկ մասնավոր որոնման ինդեքսը համապատասխանաբար գտնում է առնչվող տեքստն ու պատկերները։
Այնուամենայնիվ, այս մոդելները տարբերվում են նրանով, թե ինչպես են որոնում մեծ փաստաթղթերում, որոնք գերազանցում են համատեքստային պատուհանը․
GPT-շարքի մոդելներ
Մեկ որոնում յուրաքանչյուր հարցման համար. GPT-շարքի մոդելները կատարում են մեկ որոնում յուրաքանչյուր օգտատիրոջ հարցման համար։
Արդյունավետ կիրառման դեպքեր. Հարմար է լայնածավալ փաստաթղթերում ներառված պարզ հարցերին պատասխանելու համար։
Հարցումների օրինակներ.
«Ո՞րն է վաղաժամ թոշակի անցնելու կադրային քաղաքականությունը»։
«Ի՞նչ է անում
process_orderֆունկցիան»։
o-շարքի մոդելներ
Մեկ հարցման համար մի քանի որոնում. Կարող է կատարել մի քանի որոնում (սովորաբար՝ 2–3) յուրաքանչյուր օգտատիրոջ հարցման համար՝ յուրաքանչյուրը եզակի որոնման արտահայտությամբ։ Որոնումները կատարվում են հաջորդաբար, և մոդելը կարող է թարմացնել իր մոտեցումը՝ հիմնվելով նախորդ որոնումներում ստացված տեղեկությունների վրա։
Արդյունավետ կիրառման դեպքեր. Ավելի հարմար է բարդ հարցերի համար, որոնք պահանջում են մի քանի նպատակային որոնումներ լայնածավալ փաստաթղթերում։
Հարցումների օրինակներ.
«Որո՞նք են վաղաժամ թոշակի անցնելու, ծնողական արձակուրդի և արտասահման տեղափոխման կադրային քաղաքականությունները»։
«Բացատրեք, թե ինչ է անում
process_orderֆունկցիան, թվարկեք այս ֆունկցիայի կանչած բոլոր մեթոդները և հակիրճ նկարագրեք յուրաքանչյուր կանչված մեթոդ»։
Չնայած իրենց ուժեղ կողմերին՝ o-շարքի մոդելները կարող են դժվարանալ, երբ հարցումը պահանջում է ավելի քան երեք որոնում։
Ֆայլերի որոնման արդյունքները բարելավելու խորհուրդներ
Փորձեք օգտագործել o-շարքի մոդել բարդ հարցերի համար, որոնք պահանջում են մի քանի որոնում։
Հիշեք, որ պատասխանները կարող են տարբերվել՝ կախված ձեր վերբեռնած փաստաթղթերի տեսակից, քանակից և չափից։
Ընդհանուր առմամբ, ավելի քիչ և կենտրոնացված փաստաթղթեր բեռնելը կհանգեցնի ավելի բարձր ճշգրտության։
Բազմահարց թեմաները վերածեք առանձին հարցերի․
Եթե պետք է իմանաք յուրաքանչյուր նահանգի կադրային քաղաքականությունները, հարցրեք դրանք մեկ առ մեկ։
Եթե պետք է ամփոփեք բազմաթիվ փաստաթղթեր, խնդրեք մեկ փաստաթուղթ միանգամից։ Եթե այդ փաստաթուղթը հարյուրավոր էջեր ունի, մտածեք այն ավելի փոքր բաղադրիչների բաժանելու մասին։
Կարող եք ChatGPT Enterprise-ին խնդրել գրել «ամփոփումների ամփոփում», եթե նրան տրամադրեք մի քանի ամփոփում, ոչ թե ամբողջական փաստաթղթեր։
Եթե ունեք առաջարկի հարցման (RFP) CSV, որտեղ յուրաքանչյուր տող առանձին հարց է, հարցրեք դրանք մեկ առ մեկ՝ պարզապես CSV-ն բեռնելու և մեկ պատասխան խնդրելու փոխարեն։
Գտեք մոդելի պատասխանները աուդիտի ենթարկելու եղանակներ։ GPT հրահանգների օրինակները ստորև են․
# Համատեքստ
Դուք փաստաթղթեր հասկանալու փորձագետ եք։ Օգտվողը կկցի փաստաթուղթ և կտա հարց։ Նրանց անհրաժեշտ է կարողանալ ձեր պատասխանը կապել տեքստի այն ճշգրիտ հատվածի հետ, որտեղից վերցրել եք պատասխանը։
# Հրահանգներ
1. Պատասխանեք օգտվողի հարցին՝ հիմնվելով նրա կցված փաստաթղթի վրա և օգտագործելով ստորև տրված ճշգրիտ ձևաչափը
# Ձևաչափ
- Հարց՝ { կրկնեք օգտվողի հարցը }
- Պատասխան՝ { տրամադրեք օգտվողի հարցի պատասխանը }
Աղբյուր՝
- - Բաժնի համարը՝ { նշեք բաժնի համարը, որտեղից վերցրել եք պատասխանը }
- - Բաժնի վերնագիրը՝ { նշեք բաժնի վերնագիրը, որտեղից վերցրել եք պատասխանը }
- - Ճշգրիտ տեքստը՝ { նշեք այն ճշգրիտ տեքստը, որտեղից վերցրել եք պատասխանը }
# Կանոններ
- Տվեք հստակ և հակիրճ պատասխաններ
- Տրամադրեք միայն փաստաթղթում տրված տեղեկատվությունը
- Եթե չեք կարող գտնել պատասխանը փաստաթղթում, պարզապես պատասխանեք «Տեղեկություն չի գտնվել»։