ChatGPT Enterprise ახლა მხარს უჭერს მოთხოვნებში ჩართულ PDF ფაილებში ჩაშენებული ვიზუალური მასალის (სურათები, გრაფიკები, დიაგრამები და ა.შ.) წაკითხვასა და გაგებას. მომხმარებლებს შეუძლიათ PDF-ის ატვირთვა და ChatGPT-ს შეუძლია ამ ფაილში არსებული ტექსტის და ნებისმიერი ვიზუალური ელემენტის ინტერპრეტაცია.
დეტალებისთვის იხილეთ Visual Retrieval with PDFs FAQ.
ChatGPT Enterprise-ში ფაილების ატვირთვა რამდენიმე გზით შეგიძლიათ:
პირდაპირ თქვენი კომპიუტერიდან
როგორც GPT-ის ცოდნა
როგორც პროექტის ფაილი
ამ სახელმძღვანელოში ახსნილია, როგორ ამუშავებს ChatGPT Enterprise-ის ფუნქციები ფაილებს მათი ტიპის, რაოდენობისა და ზომის მიხედვით. ასევე განხილულია ფაილების მოთხოვნების გათვალისწინებით შედეგების გაუმჯობესების სტრატეგიები.
შეჯამება
ChatGPT Enterprise სხვადასხვა ტიპის ფაილებს სრულიად განსხვავებულად ამუშავებს: ტექსტური დოკუმენტებიდან, როგორიცაა PDF, პრეზენტაცია და Word-ის ფაილი, ტექსტს ამოიღებს; ცხრილებიდან სტრუქტურირებულ მონაცემებს Python-ის კოდით აანალიზებს; ხოლო სურათების ფაილებს GPT-Vision-ის მეშვეობით აღწერს. მოსალოდნელი შედეგის მისაღებად მნიშვნელოვანია იცოდეთ, ფაილის რომელი ტიპი რომელ სამუშაო პროცესს ააქტიურებს.
ტექსტური დოკუმენტებისთვის ChatGPT Enterprise მოთხოვნასთან უშუალოდ ათავსებს რაც შეიძლება მეტ რელევანტურ ტექსტს, ხოლო დამატებით ინფორმაციაზე წვდომისთვის საძიებო სისტემას იყენებს. ეს მიდგომა კარგად მუშაობს კონკრეტულ კითხვებზე პასუხის გაცემისას. თუმცა, ამ მიდგომას შეიძლება გაუჭირდეს ისეთი რთული ამოცანების შესრულება, როგორიცაა ძალიან დიდი დოკუმენტების შეჯამება ან რამდენიმე დიდი ფაილის შედარება. განაგრძეთ კითხვა და გაეცანით შედეგების გაუმჯობესების სტრატეგიებს.
ფაილების დამუშავება ტიპის მიხედვით
ChatGPT Enterprise ფაილებს სამი ძირითადი გზით ამუშავებს: ტექსტის ამოღებით, კოდის ანალიზითა და სურათის ინტერპრეტაციით. ფაილის ტიპი განსაზღვრავს, რომელ სამუშაო პროცესს გამოიყენებს ChatGPT Enterprise.
| ტექსტზე დაფუძნებული მოძიება | კოდის ინტერპრეტატორი | სურათის დამუშავება | ვიზუალური მოძიება | |
|---|---|---|---|---|
| ფაილის ტიპების მაგალითები | pptx, docx, txt, md, json, xml, pdf* * PDF-ები, რომლებიც ატვირთულია როგორც GPT-ის ცოდნა ან პროექტის ფაილები | csv, xls, xlsx* *შენიშვნა: კოდის ინტერპრეტატორს ნებისმიერი ტიპის ფაილთან მუშაობა შეუძლია, თუმცა ელექტრონული ცხრილებისთვის ChatGPT Enterprise ყველაზე ხშირად ნაგულისხმევად CI-ს იყენებს | jpg, png | pdf* * მომხმარებლის მოთხოვნებში ჩართული PDF-ები |
| ქცევა | ფაილიდან ტექსტს ამოიღებს — ტექსტის ნაწილი პირდაპირ კონტექსტურ ფანჯარაში „ჩაისმება“, ნაწილი კი ძიებისთვის ინახება | კოდის ინტერპრეტატორი ფაილს დასამუშავებლად Python-ს გადასცემს | სურათების ინტერპრეტაციას მულტიმოდალური მოდელები უშუალოდ ახდენს, ცნობილი შეზღუდვების გათვალისწინებით. | ტექსტის მოძიებისა და სურათის დამუშავების ჰიბრიდული მეთოდი. ტექსტი ციფრული გზით ამოიღება, ხოლო ვიზუალური შიგთავსის ინტერპრეტაციას მულტიმოდალური მოდელები უშუალოდ ახდენს. |
მხოლოდ ტექსტის შემცველი ფაილებისთვის, სურათების ფაილებისთვის ან მკაფიოდ სტრუქტურირებული მონაცემთა ფაილებისთვის (მაგალითად, ტრანზაქციების Excel-ცხრილისთვის) ეს დაყოფა საუკეთესო შესაძლო ქცევას ასახავს.
არსებობს რამდენიმე ნაკლებად აშკარა, ბუნდოვანი შემთხვევაც, მაგალითად:
PDF-ის გარდა სხვა ფაილებში ჩაშენებული სურათები არ მუშავდება. მათი ჩასართავად ატვირთვამდე ფაილი PDF-ად გარდაქმენით.
ელექტრონულ ცხრილებთან სამუშაოდ ChatGPT Enterprise ყოველთვის კოდის ინტერპრეტატორს გამოიყენებს, მაშინაც კი, თუ დოკუმენტი დიდი რაოდენობით ტექსტს შეიცავს. მაგალითად, თუ ChatGPT Enterprise-ს ტექსტის 10-სტრიქონიანი CSV ფაილის თარგმნას სთხოვთ, ის ფაილის თარგმნას Python-ის ბიბლიოთეკით შეეცდება, რაც ნაკლებად ზუსტია, ვიდრე მოდელისთვის თარგმანის უშუალოდ გენერირების შესაძლებლობის მიცემა. ამის თავიდან ასაცილებლად სცადეთ ელექტრონული ცხრილის ტექსტურ ფორმატში ექსპორტი (მაგალითად, PDF-ში).
ანალოგიურად, თუ JSON ფაილში მოცემულ სტრუქტურირებულ ტრანზაქციულ ცხრილს ატვირთავთ, ChatGPT Enterprise ამ ფაილს უბრალო ტექსტად აღიქვამს. თუ JSON ფაილში მოცემული მონაცემების გაანალიზება გსურთ, მოთხოვნაში მოდელს კოდის ინტერპრეტატორის გამოყენება დაავალეთ.
ფაილების დამუშავება ზომის მიხედვით
ChatGPT Enterprise იყენებს მოდელებს, რომელთა მაქსიმალური კონტექსტური ფანჯარაა 128k token (დაახლოებით 200 გვერდი ტექსტი). თუმცა, ყველა token არ გამოიყენება ატვირთული ფაილებიდან ტექსტის ჩასართავად. „ჩასმული“ token-ების რაოდენობა გამოყენების ტიპის მიხედვით იცვლება.
ChatGPT Enterprise ტექსტის გარკვეულ რაოდენობას „ჩასვამს“, ხოლო დარჩენილი ტექსტი იგზავნება კერძო საძიებო ინდექსში („ვექტორული საცავი“, მონაცემთა ბაზის ტიპი, რომელიც შექმნილია დიდი მოცულობის ტექსტის ეფექტურად შესანახად და მოსაძიებლად). როცა კითხვას სვამთ, ChatGPT Enterprise ჩართულ ტექსტთან ერთად მოაქვს კერძო საძიებო ინდექსიდან მოძიებული შესაბამისი ფრაგმენტები.
თუ ერთ დოკუმენტს ატვირთავთ, ChatGPT Enterprise მოიცავს ტექსტს დასაწყისიდან, სანამ თავის ლიმიტს მიაღწევს. თუ რამდენიმე დოკუმენტს ატვირთავთ, ChatGPT Enterprise თითოეული დოკუმენტის ნაწილს ან მთელ დოკუმენტს მოიცავს. დოკუმენტებიდან მთელი ტექსტი ასევე იგზავნება კერძო საძიებო ინდექსში.
კონტექსტის შევსება ტექსტური დოკუმენტებისთვის
ეს ფუნქცია აქტიური განვითარების პროცესშია. შესაბამისად, ქვემოთ მოცემული დეტალები შეიძლება წინასწარი გაფრთხილების გარეშე შეიცვალოს.
ChatGPT Enterprise-ს შეუძლია ატვირთული დოკუმენტებიდან კონტექსტურ ფანჯარაში დაამუშაოს მაქსიმუმ 110k token. თუ ატვირთავთ ერთ ან მეტ დოკუმენტს, რომელთა ჯამური მოცულობა 110k token-ზე ნაკლებია, სრული კონტენტი ჩართული იქნება.
ერთი დოკუმენტისთვის, რომელიც 110k token-ს აღემატება, ჩართული იქნება მხოლოდ პირველი 110k token, დასაწყისიდან. დარჩენილი ნაწილი მხოლოდ კერძო საძიებო ინდექსში გაიგზავნება.
თუ ატვირთულია რამდენიმე დოკუმენტი და მათი ჯამური მოცულობა 110k token-ს აღემატება, ChatGPT Enterprise დოკუმენტების წარმოდგენის დასაბალანსებლად ორსაფეხურიან პროცესს იყენებს:
ამოიღეთ მაქსიმუმ 55k token, რომლებიც ატვირთულ დოკუმენტებს შორის თანაბრად ნაწილდება.
დოკუმენტებისთვის, რომლებიც პირველ ნაბიჯში სრულად არ არის წარმოდგენილი, დარჩენილი 55k token გამოყავით პროპორციულად, თითოეულ დოკუმენტში დარჩენილი token-ების მიხედვით.
ყველა დარჩენილი token მხოლოდ კერძო საძიებო ინდექსში იგზავნება.
ტექსტურ დოკუმენტში token-ების რაოდენობის შეფასება შეგიძლიათ დოკუმენტის ტექსტის OpenAI Tokenizer-ში კოპირებით.
კონტექსტის შევსება მულტიმედიური PDF-ებისთვის
როცა მომხმარებლები ატვირთავენ PDF-ებს, რომლებიც ტექსტსაც და სურათებსაც შეიცავს, Visual Retrieval ChatGPT-ს საშუალებას აძლევს, ეს სურათები ციფრულად ამოღებულ ტექსტთან ერთად ბუნებრივად დაამუშაოს. შემდეგი ნაბიჯები ავსებს მულტიმედიური PDF-ებისთვის კონტექსტთან მუშაობის ჩვენს სტანდარტულ პროცედურებს:
სურათების ამოღება და embedding: სურათები ამოიღება და embedding-დება მათთან დაკავშირებულ ციფრულ ტექსტთან ერთად.
გონიერი მასშტაბირება: სურათები ავტომატურად მასშტაბირდება, რათა შენარჩუნდეს ბალანსი ინფორმაციის ხარისხსა და ხელმისაწვდომი კონტექსტური ფანჯრის ეფექტურ გამოყენებას შორის.
როცა ატვირთული PDF-ები 110k token-ის ლიმიტს აღემატება, სურათებიც და ტექსტიც კერძო საძიებო ინდექსში embedding-დება. ტექსტური embedding-ები შესაბამის სურათებზე მიუთითებს, რაც ChatGPT-ს საშუალებას აძლევს, მომხმარებლის მოთხოვნების საფუძველზე შესაბამისი ტექსტ-სურათის წყვილები მოიძიოს. შემდეგ მოძიებული სურათები მუშავდება ChatGPT-ის ბუნებრივი მულტიმოდალური შესაძლებლობებით.
მულტიმედიური PDF-ებისთვის token-ების საჭიროების ზუსტად შეფასება რთულია. ტესტირება მიუთითებს, რომ შერეული ტექსტისა და სურათების დაახლოებით 350 გვერდი სრულად გამოიყენებს 110k token-იან კონტექსტურ ფანჯარას.
ძიების სტრატეგიები მოდელის ტიპის მიხედვით
როგორც GPT-სერიის, ისე o-სერიის მოდელები მხარს უჭერენ ფაილების ატვირთვას და იყენებენ ერთნაირ კონტექსტის შევსებისა და საძიებო embedding-ის ლოგიკას. ყველა მოდელი ასრულებს ჰიბრიდულ ძიებებს კერძო საძიებო ინდექსში, საკვანძო სიტყვებისა და სემანტიკური მეთოდების კომბინირებით. ჰიბრიდული ძიებისას მოდელი ქმნის საძიებო ფრაზას მომხმარებლის მოთხოვნის საფუძველზე, ხოლო კერძო საძიებო ინდექსი შესაბამისად მოიძიებს შესაბამის ტექსტსა და სურათებს.
თუმცა, ეს მოდელები განსხვავდებიან იმით, თუ როგორ ეძებენ დიდ დოკუმენტებში, რომლებიც კონტექსტურ ფანჯარას აღემატება:
GPT-სერიის მოდელები
ერთი ძიება თითო მოთხოვნაზე: GPT-სერიის მოდელები მომხმარებლის თითოეულ მოთხოვნაზე ერთ ძიებას ასრულებს.
ეფექტური გამოყენების შემთხვევები: იდეალურია ვრცელ დოკუმენტაციაში მოცემულ მარტივ კითხვებზე პასუხის გასაცემად.
მოთხოვნების მაგალითები:
„როგორია ადამიანური რესურსების პოლიტიკა ვადამდელი პენსიაზე გასვლის შესახებ?“
„რას აკეთებს ფუნქცია process_order?“
o-სერიის მოდელები
რამდენიმე ძიება თითო მოთხოვნაზე: მომხმარებლის თითოეული მოთხოვნისთვის შეუძლია რამდენიმე ძიების (ჩვეულებრივ, 2–3-ის) შესრულება, თითოეული უნიკალური საძიებო ფრაზით. ძიებები თანმიმდევრულად სრულდება და მოდელს შეუძლია მიდგომა წინა ძიებებით მოპოვებული ინფორმაციის საფუძველზე განაახლოს.
ეფექტური გამოყენების შემთხვევები: უფრო შესაფერისია რთული კითხვებისთვის, რომლებიც ვრცელ დოკუმენტაციაში რამდენიმე მიზნობრივ ძიებას მოითხოვს.
მოთხოვნების მაგალითები:
„როგორია ადამიანური რესურსების პოლიტიკა ვადამდელი პენსიაზე გასვლის, მშობლის შვებულებისა და საზღვარგარეთ გადაყვანის შესახებ?“
„ახსენით, რას აკეთებს ფუნქცია process_order, ჩამოთვალეთ მის მიერ გამოძახებული ყველა მეთოდი და მოკლედ აღწერეთ თითოეული მათგანი.“
ძლიერი მხარეების მიუხედავად, o-სერიის მოდელებს შეიძლება გაუჭირდეთ მოთხოვნების დამუშავება, რომლებიც სამზე მეტ ძიებას საჭიროებს.
რჩევები ფაილების ძიების შედეგების გასაუმჯობესებლად
რთული კითხვებისთვის, რომლებიც რამდენიმე ძიებას მოითხოვს, სცადეთ o-სერიის მოდელის გამოყენება.
გახსოვდეთ, რომ პასუხები შეიძლება განსხვავდებოდეს თქვენ მიერ ატვირთული დოკუმენტების ტიპის, რაოდენობისა და ზომის მიხედვით.
ზოგადად, ნაკლები და უფრო ფოკუსირებული დოკუმენტების ჩატვირთვა უფრო მაღალ სიზუსტეს უზრუნველყოფს.
მრავალკითხვიანი თემები ერთეულ კითხვებად გადააქციეთ:
თუ ყველა შტატის HR პოლიტიკის ცოდნა გჭირდებათ, თითოეული ცალ-ცალკე იკითხეთ.
თუ ბევრი დოკუმენტის შეჯამება გჭირდებათ, ერთ ჯერზე ერთი დოკუმენტი მოითხოვეთ. თუ ეს დოკუმენტი მრავალი ასეული გვერდისგან შედგება, განიხილეთ მისი უფრო მცირე კომპონენტებად დაყოფა.
შეგიძლიათ ChatGPT Enterprise-ს „შეჯამებების შეჯამების“ დაწერა სთხოვოთ, თუ მას სრული დოკუმენტების ნაცვლად რამდენიმე შეჯამებას მიაწვდით.
თუ გაქვთ RFP-ის CSV (სადაც თითოეული სტრიქონი განსხვავებული კითხვაა), CSV-ის უბრალოდ ჩატვირთვისა და ერთი პასუხის მოთხოვნის ნაცვლად ეს კითხვები სათითაოდ დასვით.
იპოვეთ გზები მოდელის პასუხების აუდიტისთვის. GPT-ის ინსტრუქციების მაგალითები ქვემოთაა:
# კონტექსტი
თქვენ ხართ დოკუმენტების გაგების ექსპერტი. მომხმარებელი დაამაგრებს დოკუმენტს და დასვამს კითხვას. მათ უნდა შეეძლოთ თქვენი პასუხის დაკავშირება ტექსტის ზუსტად იმ ნაწილთან, საიდანაც თქვენ პასუხი აიღეთ.
# ინსტრუქციები
1. უპასუხეთ მომხმარებლის კითხვას მათი მიმაგრებული დოკუმენტის საფუძველზე ქვემოთ მოცემული ზუსტი ფორმატის გამოყენებით
# ფორმატი
- კითხვა: { გაიმეორეთ მომხმარებლის კითხვა }
- პასუხი: { მიეცით პასუხი მომხმარებლის კითხვაზე }
Source:
- - განყოფილების ნომერი: { მიუთითეთ იმ განყოფილების ნომერი, საიდანაც პასუხი აიღეთ }
- - განყოფილების სათაური: { მიუთითეთ იმ განყოფილების სათაური, საიდანაც პასუხი აიღეთ }
- - ზუსტი ტექსტი: { მიუთითეთ ზუსტი ტექსტი, საიდანაც პასუხი აიღეთ }
# წესები
- მიეცით მკაფიო და მოკლე პასუხები
- მიაწოდეთ მხოლოდ დოკუმენტში მოცემული ინფორმაცია
- თუ დოკუმენტში პასუხს ვერ პოულობთ, უბრალოდ უპასუხეთ: „ინფორმაცია ვერ მოიძებნა.“