OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

ChatGPT Enterprise मध्ये फाइल अपलोड ऑप्टिमाइझ करणे

ChatGPT Enterprise वैशिष्ट्ये फाइलचा प्रकार, संख्या आणि आकारानुसार फाइल्स कशा हाताळतात ते समजा. फाइल आवश्यकतांनुसार आउटपुट सुधारा.

अपडेट केले: 18 days ago

ChatGPT Enterprise आता प्रॉम्प्टमध्ये समाविष्ट केलेल्या PDF फाइलमध्ये एम्बेड केलेली दृश्ये (प्रतिमा, ग्राफ, आकृत्या इ.) वाचणे आणि समजणे समर्थित करते. वापरकर्ते PDF अपलोड करू शकतात आणि ChatGPT त्या फाइलमधील मजकूर आणि कोणतेही दृश्य घटक समजू शकते.

तपशीलांसाठी PDF सह व्हिज्युअल रिट्रीव्हल FAQ पहा.

ChatGPT Enterprise मध्ये अनेक प्रकारे फाइल अपलोड करता येतात:

ChatGPT Enterprise मधील वैशिष्ट्ये फाइलचा प्रकार, संख्या आणि आकार यांनुसार त्या कशा हाताळतात, हे या मार्गदर्शकात स्पष्ट केले आहे. तसेच फाइलच्या गरजांनुसार परिणाम सुधारण्याच्या धोरणांची चर्चा केली आहे.

सारांश

ChatGPT Enterprise विविध प्रकारच्या फाइल वेगवेगळ्या पद्धतींनी हाताळते: PDF, सादरीकरणे आणि Word फाइल यांसारख्या मजकूर दस्तऐवजांमधून मजकूर काढते, Python कोड वापरून स्प्रेडशीटमधील संरचित डेटाचे विश्लेषण करते आणि GPT-व्हिजनद्वारे प्रतिमा फाइलचे वर्णन करते. अपेक्षित परिणाम मिळवण्यासाठी कोणत्या प्रकारच्या फाइलमुळे कोणती कार्यप्रक्रिया सुरू होते, हे समजून घेणे महत्त्वाचे आहे.

मजकूर-आधारित दस्तऐवजांसाठी ChatGPT Enterprise शक्य तितका संबंधित मजकूर थेट प्रॉम्प्टसोबत समाविष्ट करते आणि अतिरिक्त माहिती मिळवण्यासाठी शोध प्रणाली वापरते. विशिष्ट प्रश्नांची उत्तरे देण्यासाठी ही पद्धत उपयुक्त ठरते. मात्र, खूप मोठ्या दस्तऐवजांचा सारांश तयार करणे किंवा अनेक मोठ्या फाइलची तुलना करणे यांसारख्या गुंतागुंतीच्या कामांमध्ये ही पद्धत कमी प्रभावी ठरू शकते. तुमचे परिणाम सुधारण्याच्या धोरणांविषयी जाणून घेण्यासाठी पुढे वाचा.

प्रकारानुसार फाइल हाताळणे

ChatGPT Enterprise फाइलवर मुख्यतः तीन प्रकारे प्रक्रिया करते: मजकूर काढणे, कोडचे विश्लेषण करणे आणि प्रतिमेचा अर्थ लावणे. ChatGPT Enterprise कोणती कार्यप्रक्रिया वापरेल, हे फाइलच्या प्रकारावर ठरते.

मजकूर-आधारित पुनर्प्राप्तीकोड इंटरप्रिटरप्रतिमा प्रक्रियादृश्य पुनर्प्राप्ती
फाइल प्रकारांची उदाहरणेpptx, docx, txt, md, json, xml, pdf*
*

GPT ज्ञान
किंवा

प्रकल्प फाइल
म्हणून अपलोड केलेल्या PDF फाइल
csv, xls, xlsx*
*टीप: कोड इंटरप्रिटर कोणत्याही प्रकारच्या फाइलवर काम करू शकतो, मात्र ChatGPT Enterprise स्प्रेडशीटसाठी सामान्यतः CI वापरते.
jpg, pngpdf*
* वापरकर्त्याच्या प्रॉम्प्टमध्ये समाविष्ट केलेल्या PDF फाइल
वर्तनफाइलमधील मजकूर काढला जातो. त्यातील काही मजकूर थेट कॉन्टेक्स्ट विंडोमध्ये चिकटवला (“भरला”) जातो, तर काही मजकूर शोधासाठी साठवला जातो.कोड इंटरप्रिटर प्रक्रियेसाठी फाइल Python कडे पाठवतो.मल्टी-मोडल मॉडेल प्रतिमांचा थेट अर्थ लावतात. यावर

ज्ञात मर्यादा
लागू होतात.
मजकूर पुनर्प्राप्ती आणि प्रतिमा प्रक्रिया यांचे मिश्रण. मजकूर डिजिटल पद्धतीने काढला जातो आणि मल्टी-मोडल मॉडेल दृश्य सामग्रीचा थेट अर्थ लावतात.

केवळ मजकूर असलेल्या फाइल, प्रतिमा फाइल किंवा स्पष्टपणे संरचित डेटा फाइलसाठी (उदा., व्यवहारांची Excel सारणी) हे वर्गीकरण शक्य तितके सर्वोत्तम वर्तन दर्शवते.

काही बाबतींत हे वर्गीकरण तितकेसे स्पष्ट नसते. उदाहरणार्थ:

  • PDF व्यतिरिक्त इतर फाइलमध्ये अंतर्भूत केलेल्या प्रतिमांवर प्रक्रिया केली जात नाही. त्या समाविष्ट करण्यासाठी अपलोड करण्यापूर्वी फाइलचे PDF मध्ये रूपांतर करा.

  • दस्तऐवजात मोठ्या प्रमाणात मजकूर असला, तरीही ChatGPT Enterprise स्प्रेडशीटशी संवाद साधण्यासाठी नेहमी कोड इंटरप्रिटर वापरेल. उदाहरणार्थ, तुम्ही ChatGPT Enterprise ला मजकुराच्या 10 ओळी असलेल्या CSV फाइलचे भाषांतर करण्यास सांगितल्यास, ते Python लायब्ररी वापरून फाइलचे भाषांतर करण्याचा प्रयत्न करेल. मॉडेलला थेट भाषांतर तयार करू देण्याच्या तुलनेत ही पद्धत कमी अचूक आहे. ही समस्या कमी करण्यासाठी स्प्रेडशीट मजकूर-आधारित स्वरूपात, उदाहरणार्थ PDF म्हणून, निर्यात करून पाहा.

  • त्याचप्रमाणे, तुम्ही JSON फाइलमधील संरचित व्यवहार सारणी अपलोड केल्यास, ChatGPT Enterprise त्या फाइलचा साधा मजकूर म्हणून अर्थ लावेल. JSON फाइलमधील डेटाचे विश्लेषण करायचे असल्यास, तुमच्या प्रॉम्प्टमध्ये मॉडेलला कोड इंटरप्रिटर वापरण्याची सूचना द्या.

आकारावर आधारित फाइल हाताळणी

ChatGPT Enterprise कमाल 128k टोकनच्या कॉन्टेक्स्ट विंडोची मॉडेल वापरते (साधारणपणे 200 पानांचा मजकूर). तथापि, अपलोड केलेल्या फाइलमधील मजकूर समाविष्ट करण्यासाठी सर्व टोकन वापरले जात नाहीत. “स्टफ्ड” टोकनची संख्या वापराच्या प्रकारानुसार बदलते.

ChatGPT Enterprise काही प्रमाणात मजकूर “स्टफ” करते आणि उरलेला मजकूर खासगी शोध इंडेक्सकडे पाठवला जातो (“व्हेक्टर स्टोअर”, जो मोठ्या प्रमाणातील मजकूर कार्यक्षमतेने साठवण्यासाठी आणि परत मिळवण्यासाठी बनवलेला डेटाबेसचा एक प्रकार आहे). तुम्ही प्रश्न विचारता तेव्हा, ChatGPT Enterprise समाविष्ट केलेल्या मजकुरासोबत खासगी शोध इंडेक्समधून मिळवलेले संबंधित भाग आणते.

तुम्ही एकच दस्तऐवज अपलोड केल्यास, ChatGPT Enterprise सुरुवातीपासून मजकूर समाविष्ट करते आणि त्याची मर्यादा येईपर्यंत तो घेत राहते. तुम्ही अनेक दस्तऐवज अपलोड केल्यास, ChatGPT Enterprise प्रत्येक दस्तऐवजाचा काही किंवा सर्व भाग समाविष्ट करते. दस्तऐवजांमधील सर्व मजकूर खासगी शोध इंडेक्सकडेही पाठवला जातो.

मजकूर दस्तऐवजांसाठी कॉन्टेक्स्ट स्टफिंग

हे वैशिष्ट्य सध्या सक्रिय विकासाधीन आहे. त्यामुळे, खालील तपशील पूर्वसूचना न देता बदलू शकतात.

ChatGPT Enterprise अपलोड केलेल्या दस्तऐवजांमधून कॉन्टेक्स्ट विंडोमध्ये 110k टोकनपर्यंत प्रक्रिया करू शकते. तुम्ही एक किंवा अधिक दस्तऐवज अपलोड केले आणि त्यांची एकूण बेरीज 110k टोकनपेक्षा कमी असेल, तर पूर्ण सामग्री समाविष्ट केली जाईल.

110k टोकनपेक्षा जास्त असलेल्या एकाच दस्तऐवजासाठी, सुरुवातीपासून फक्त पहिले 110k टोकन समाविष्ट केले जातील. उर्वरित भाग फक्त खासगी शोध इंडेक्सकडे पाठवला जाईल.

अनेक दस्तऐवज अपलोड केले आणि त्यांची एकूण बेरीज 110k टोकनपेक्षा जास्त असेल, तर ChatGPT Enterprise दस्तऐवजांचे प्रतिनिधित्व संतुलित करण्यासाठी दोन-टप्प्यांची प्रक्रिया वापरते:

  1. अपलोड केलेल्या दस्तऐवजांमध्ये समान रीतीने विभागून 55k टोकनपर्यंत काढा.

  1. पहिल्या टप्प्यात पूर्णपणे प्रतिनिधित्व न झालेल्या दस्तऐवजांसाठी, प्रत्येक दस्तऐवजात उरलेल्या टोकनच्या आधारे उरलेले 55k टोकन प्रमाणानुसार वाटप करा.

  1. उरलेली कोणतीही टोकन फक्त खासगी शोध इंडेक्सकडे पाठवली जातात.

मजकूर दस्तऐवजात किती टोकन आहेत याचा अंदाज घेण्यासाठी दस्तऐवजाचा मजकूर OpenAI टोकनायझरमध्ये कॉपी करू शकता.

मल्टिमीडिया PDF साठी कॉन्टेक्स्ट स्टफिंग

वापरकर्ते मजकूर आणि प्रतिमा दोन्ही असलेले PDF अपलोड करतात तेव्हा, व्हिज्युअल रिट्रीव्हल ChatGPT ला डिजिटलरीत्या काढलेल्या मजकुरासोबत या प्रतिमांवर नेटिव्ह पद्धतीने प्रक्रिया करण्यास सक्षम करते. खालील टप्पे मल्टिमीडिया PDF साठी आमच्या मानक कॉन्टेक्स्ट-हाताळणी प्रक्रियांना पूरक आहेत:

  • प्रतिमा काढणे आणि एम्बेडिंग: प्रतिमा काढल्या जातात आणि त्यांच्याशी संबंधित डिजिटल मजकुरासह एम्बेड केल्या जातात.

  • बुद्धिमान स्केलिंग: माहितीची गुणवत्ता आणि उपलब्ध कॉन्टेक्स्ट विंडोचा कार्यक्षम वापर यांच्यात संतुलन राखण्यासाठी प्रतिमांचे आपोआप स्केलिंग केले जाते.

अपलोड केलेले PDF 110k टोकन मर्यादेपेक्षा जास्त असल्यास, प्रतिमा आणि मजकूर दोन्ही खासगी शोध इंडेक्समध्ये एम्बेड केले जातात. मजकूर एम्बेडिंग संबंधित प्रतिमांचा संदर्भ देतात, ज्यामुळे ChatGPT वापरकर्ता क्वेरींवर आधारित योग्य मजकूर-प्रतिमा जोड्या मिळवू शकते. मिळवलेल्या प्रतिमांवर नंतर ChatGPT च्या नेटिव्ह मल्टिमोडल क्षमतांचा वापर करून प्रक्रिया केली जाते.

मल्टिमीडिया PDF साठी टोकन आवश्यकतांचा अचूक अंदाज घेणे अवघड आहे. चाचणीनुसार, मिश्र मजकूर आणि प्रतिमांची साधारण 350 पाने 110k टोकन कॉन्टेक्स्ट विंडो पूर्णपणे वापरतील.

मॉडेल प्रकारावर आधारित शोध धोरणे

GPT-श्रेणी आणि o-श्रेणीची दोन्ही मॉडेल फाइल अपलोडला समर्थन देतात आणि समान कॉन्टेक्स्ट स्टफिंग व शोध एम्बेडिंग लॉजिक वापरतात. सर्व मॉडेल खासगी शोध इंडेक्सवर हायब्रिड शोध चालवतात, ज्यात कीवर्ड आणि सिमॅंटिक पद्धती एकत्र केल्या जातात. हायब्रिड शोधात, मॉडेल वापरकर्त्याच्या प्रॉम्प्टवर आधारित शोध वाक्यांश तयार करते आणि खासगी शोध इंडेक्स त्यानुसार संबंधित मजकूर व प्रतिमा मिळवतो.

तथापि, कॉन्टेक्स्ट विंडोपेक्षा मोठ्या दस्तऐवजांमध्ये शोध घेताना ही मॉडेल वेगवेगळी वागतात:

GPT-मालिकेतील मॉडेल

  • प्रत्येक प्रॉम्प्टसाठी एक शोध: GPT-मालिकेतील मॉडेल वापरकर्त्याच्या प्रत्येक प्रॉम्प्टसाठी एक शोध घेतात.

  • उपयुक्त वापर: विस्तृत दस्तऐवजांमधील सरळ प्रश्नांची उत्तरे देण्यासाठी आदर्श.

उदाहरणार्थ प्रश्न:

  • "लवकर निवृत्तीसाठी मानव संसाधन धोरण काय आहे?"

  • "process_order हे फंक्शन काय करते?"

o-मालिकेतील मॉडेल

  • प्रत्येक प्रॉम्प्टसाठी अनेक शोध: वापरकर्त्याच्या प्रत्येक प्रॉम्प्टसाठी स्वतंत्र शोध-वाक्यांश वापरून अनेक शोध (सामान्यतः 2-3) घेता येतात. शोध क्रमाने घेतले जातात आणि आधीच्या शोधांमधून मिळालेल्या माहितीच्या आधारे मॉडेल आपली पद्धत बदलू शकते.

  • उपयुक्त वापर: विस्तृत दस्तऐवजांमध्ये अनेक लक्ष्यित शोध घ्यावे लागणाऱ्या गुंतागुंतीच्या प्रश्नांसाठी अधिक योग्य.

उदाहरणार्थ प्रश्न:

  • "लवकर निवृत्ती, पालकत्व रजा आणि परदेशात बदली यांसाठी मानव संसाधन धोरणे कोणती आहेत?"

  • "process_order हे फंक्शन काय करते ते स्पष्ट करा, या फंक्शनद्वारे वापरल्या जाणाऱ्या सर्व मेथडची सूची द्या आणि प्रत्येक मेथडचे थोडक्यात वर्णन करा."

क्षमता असूनही, एखाद्या प्रश्नासाठी तीनपेक्षा जास्त शोध आवश्यक असल्यास o-मालिकेतील मॉडेलना अडचण येऊ शकते.

फाइल शोध परिणाम सुधारण्यासाठी टिपा

  • अनेक शोधांची गरज असलेल्या गुंतागुंतीच्या प्रश्नांसाठी o-श्रेणीचे मॉडेल वापरून पाहा.

  • लक्षात ठेवा की तुम्ही अपलोड केलेल्या दस्तऐवजांचा प्रकार, संख्या आणि आकार यावर प्रतिसाद बदलू शकतात.

  • साधारणपणे, कमी आणि केंद्रित दस्तऐवज लोड केल्यास अचूकता अधिक मिळेल.

  • अनेक प्रश्न असलेले विषय एकेका प्रश्नात बदला:

    • प्रत्येक राज्याची HR धोरणे जाणून घ्यायची असल्यास, ती एक-एक करून विचारा.

    • अनेक दस्तऐवजांचा सारांश हवा असल्यास, एका वेळी एकाच दस्तऐवजाबद्दल विचारा. तो दस्तऐवज अनेक शेकडो पानांचा असल्यास, तो लहान घटकांमध्ये विभागण्याचा विचार करा.

      • संपूर्ण दस्तऐवजांऐवजी तुम्ही ChatGPT Enterprise ला अनेक सारांश दिल्यास, त्याला “सारांशांचा सारांश” लिहायला सांगू शकता.

    • तुमच्याकडे RFP ची CSV असल्यास (प्रत्येक ओळ एक वेगळा प्रश्न आहे), फक्त CSV लोड करून एकच प्रतिसाद मागण्याऐवजी ते प्रश्न एक-एक करून विचारा.

  • मॉडेलच्या प्रतिसादांचे ऑडिट करण्याचे मार्ग शोधा. उदाहरण GPT सूचना खाली दिल्या आहेत:

# Context 

तुम्ही दस्तऐवज समजून घेण्यात तज्ञ आहात. वापरकर्ता एक दस्तऐवज जोडणार आहे आणि प्रश्न विचारणार आहे. तुमचे उत्तर तुम्ही ज्या मजकूराच्या अचूक भागातून घेतले आहे त्याशी ते जोडता आले पाहिजे.

# Instructions

1. खाली दिलेल्या अचूक फॉर्मॅटनुसार वापरकर्त्याच्या जोडलेल्या दस्तऐवजावर आधारित त्याच्या प्रश्नाचे उत्तर द्या.

# Format

- Question: { वापरकर्त्याचा प्रश्न पुन्हा लिहा }
- Answer: { वापरकर्त्याच्या प्रश्नाचे उत्तर द्या }
Source:
- - Section Number: { तुम्ही उत्तर ज्या विभाग क्रमांकातून घेतले तो द्या }
- - Section Title: { तुम्ही उत्तर ज्या विभाग शीर्षकातून घेतले ते द्या }
- - Exact Text: { तुम्ही उत्तर ज्या अचूक मजकूरातून घेतले तो द्या }

# Rules

- उत्तरे स्पष्ट आणि संक्षिप्त द्या.
- दस्तऐवजात दिलेलीच माहिती द्या.
- दस्तऐवजात उत्तर सापडले नाही, तर फक्त "माहिती आढळली नाही." असे उत्तर द्या.

हा लेख उपयुक्त आहे का?