ChatGPT Enterprise اکنون از خواندن و درک عناصر بصری (تصاویر، نمودارها، دیاگرامها و غیره) که در فایلهای PDF موجود در اعلانها جاسازی شدهاند پشتیبانی میکند. کاربران میتوانند یک PDF بارگذاری کنند و ChatGPT میتواند متن و هر عنصر بصری داخل آن فایل را تفسیر کند.
برای جزئیات، پرسشهای متداول بازیابی بصری با PDFها را ببینید.
ChatGPT Enterprise به شما امکان میدهد فایلها را به چند روش بارگذاری کنید:
مستقیماً از رایانه خود
بهعنوان دانش GPT
بهعنوان یک فایل پروژه
از یک اقدام GPT
این راهنما توضیح میدهد قابلیتهای ChatGPT Enterprise چگونه فایلها را بر اساس نوع، تعداد و اندازهشان مدیریت میکنند و راهبردهایی را برای بهبود خروجیها بر اساس نیازمندیهای فایل مطرح میکند.
خلاصه
ChatGPT Enterprise با انواع مختلف فایل بسیار متفاوت برخورد میکند: استخراج متن از اسناد متنی مانند PDFها، ارائهها و فایلهای Word، تحلیل دادههای ساختاریافته از صفحهگستردهها با استفاده از کد Python، و توصیف فایلهای تصویری از طریق GPT-Vision. درک اینکه کدام نوع فایل کدام گردشکار را فعال میکند، برای رسیدن به نتیجه مورد انتظار کلیدی است.
برای اسناد مبتنی بر متن، ChatGPT Enterprise تا حد امکان متن مرتبط را مستقیماً در کنار اعلان میگنجاند و از یک سیستم جستجو برای دسترسی به اطلاعات بیشتر استفاده میکند. این روش برای پاسخ به پرسشهای مشخص خوب عمل میکند. با این حال، این رویکرد میتواند در کارهای پیچیدهای مانند خلاصهسازی اسناد بسیار بزرگ یا مقایسه چند فایل بزرگ با مشکل روبهرو شود. برای آشنایی با راهبردهای بهبود نتایج خود، ادامه مطلب را بخوانید.
مدیریت فایلها بر اساس نوع
ChatGPT Enterprise فایلها را به سه روش اصلی پردازش میکند: استخراج متن، تحلیل کد و تفسیر تصویر. نوع فایل تعیین میکند ChatGPT Enterprise کدام گردشکار را دنبال کند.
| بازیابی مبتنی بر متن | مفسر کد | پردازش تصویر | بازیابی بصری | |
|---|---|---|---|---|
| نمونههای نوع فایل | pptx، docx، txt، md، json، xml، pdf* * PDFهایی که بهعنوان دانش GPT یا فایلهای پروژه بارگذاری شدهاند | csv، xls، xlsx* *توجه: مفسر کد میتواند روی هر نوع فایلی کار کند، اما ChatGPT Enterprise معمولاً بهطور پیشفرض برای صفحهگستردهها از CI استفاده میکند | jpg، png | pdf* * PDFهای گنجاندهشده در اعلانهای کاربر |
| رفتار | متن را از فایل استخراج میکند؛ بخشی از متن مستقیماً در پنجره زمینه چسبانده («گنجانده») میشود و بخشی از متن برای جستجو ذخیره میشود | مفسر کد فایل را برای پردازش به Python میسپارد | تصاویر بهصورت بومی توسط مدلهای چند مدال تفسیر میشوند، با توجه به محدودیتهای شناختهشده . | ترکیبی از بازیابی متن و پردازش تصویر. متن بهصورت دیجیتال استخراج میشود و محتوای بصری بهصورت بومی توسط مدلهای چند مدال تفسیر میشود. |
برای فایلهای فقط متنی، فایلهای تصویری یا فایلهای داده با ساختار واضح (مثلاً یک جدول Excel از تراکنشها)، این تقسیمبندیها بهترین رفتار ممکن را نشان میدهند.
برخی نواحی خاکستری وجود دارند که کمتر بدیهیاند، برای مثال:
تصاویر جاسازیشده در فایلهایی غیر از PDF پردازش نمیشوند. برای گنجاندن آنها، پیش از بارگذاری فایل را به PDF تبدیل کنید.
ChatGPT Enterprise همیشه برای تعامل با صفحهگستردهها از مفسر کد استفاده میکند، حتی اگر سند مقدار زیادی متن داشته باشد. برای مثال، اگر از ChatGPT Enterprise بخواهید یک فایل CSV با ۱۰ ردیف متن را ترجمه کند، تلاش میکند فایل را با استفاده از یک کتابخانه Python ترجمه کند که دقت کمتری نسبت به این دارد که به مدل اجازه دهید مستقیماً ترجمه تولید کند. برای کاهش این مشکل، صفحهگسترده را به یک قالب مبتنی بر متن (مثلاً PDF) صادر کنید.
بهطور مشابه، اگر یک جدول تراکنشی ساختاریافته را که در یک فایل JSON توصیف شده است بارگذاری کنید، ChatGPT Enterprise این فایل را بهعنوان متن ساده تفسیر خواهد کرد. اگر میخواهید دادههای موجود در یک فایل JSON را تحلیل کنید، در اعلان خود به مدل دستور دهید از مفسر کد استفاده کند.
مدیریت فایلها بر اساس اندازه
ChatGPT Enterprise از مدلهایی با حداکثر پنجره زمینه ۱۲۸هزار توکن (تقریباً ۲۰۰ صفحه متن) استفاده میکند. با این حال، همه توکنها برای گنجاندن متن فایلهای بارگذاریشده استفاده نمیشوند. تعداد توکنهای «گنجاندهشده» بسته به نوع استفاده متفاوت است.
ChatGPT Enterprise مقداری از متن را «میگنجاند» و متن باقیمانده به یک نمایه جستجوی خصوصی ارسال میشود (یک «ذخیرهساز برداری» که نوعی پایگاه داده است و برای ذخیره و بازیابی کارآمد حجم زیادی از متن طراحی شده است). وقتی پرسشی میپرسید، ChatGPT Enterprise متن گنجاندهشده را همراه با بخشهای مرتبطی که از یک نمایه جستجوی خصوصی بازیابی شدهاند وارد میکند.
اگر یک سند واحد بارگذاری کنید، ChatGPT Enterprise متن را از ابتدای سند تا رسیدن به حد خود شامل میکند. اگر چند سند بارگذاری کنید، ChatGPT Enterprise بخشی یا تمام هر سند را شامل میکند. همه متن اسناد نیز به یک نمایه جستجوی خصوصی ارسال میشود.
گنجاندن زمینه برای اسناد متنی
این قابلیت در حال توسعه فعال است. بنابراین، جزئیات زیر ممکن است بدون اطلاع قبلی تغییر کنند.
ChatGPT Enterprise میتواند تا ۱۱۰هزار توکن از اسناد بارگذاریشده را در پنجره زمینه پردازش کند. اگر یک یا چند سند با مجموع کمتر از ۱۱۰هزار توکن بارگذاری کنید، کل محتوا گنجانده میشود.
برای یک سند واحد که بیش از ۱۱۰هزار توکن دارد، فقط نخستین ۱۱۰هزار توکن، از ابتدای سند، گنجانده میشود. باقیمانده فقط به نمایه جستجوی خصوصی ارسال میشود.
اگر چند سند بارگذاری شوند و مجموع آنها از ۱۱۰هزار توکن فراتر رود، ChatGPT Enterprise برای متعادل کردن نمایش اسناد از یک فرایند دو مرحلهای استفاده میکند:
تا ۵۵هزار توکن را استخراج کنید که بهطور برابر میان اسناد بارگذاریشده تقسیم میشود.
برای اسنادی که در مرحله اول بهطور کامل نمایش داده نشدهاند، ۵۵هزار توکن باقیمانده را بر اساس توکنهای باقیمانده در هر سند، بهصورت متناسب اختصاص دهید.
هر توکن باقیمانده فقط به نمایه جستجوی خصوصی ارسال میشود.
میتوانید با کپی کردن متن سند در توکنیزهکننده OpenAI تعداد توکنهای یک سند متنی را برآورد کنید.
گنجاندن زمینه برای PDFهای چندرسانهای
وقتی کاربران PDFهایی را بارگذاری میکنند که هم متن و هم تصویر دارند، بازیابی بصری به ChatGPT امکان میدهد این تصاویر را همراه با متن استخراجشده دیجیتالی، بهصورت بومی پردازش کند. مراحل زیر رویههای استاندارد ما برای مدیریت زمینه در PDFهای چندرسانهای را تکمیل میکنند:
استخراج و جاسازی تصویر: تصاویر همراه با متن دیجیتال مرتبطشان استخراج و جاسازی میشوند.
مقیاسبندی هوشمند: تصاویر بهطور خودکار مقیاسبندی میشوند تا میان کیفیت اطلاعات و استفاده کارآمد از پنجره زمینه موجود تعادل برقرار شود.
وقتی PDFهای بارگذاریشده از حد ۱۱۰هزار توکن فراتر میروند، هم تصاویر و هم متن در نمایه جستجوی خصوصی جاسازی میشوند. جاسازیهای متن به تصاویر مرتبط ارجاع میدهند و به ChatGPT امکان میدهند بر اساس پرسوجوهای کاربر، جفتهای متن-تصویر مناسب را بازیابی کند. سپس تصاویر بازیابیشده با استفاده از قابلیتهای چند مدال بومی ChatGPT پردازش میشوند.
برآورد دقیق نیازمندیهای توکن برای PDFهای چندرسانهای دشوار است. آزمایشها نشان میدهد که حدود ۳۵۰ صفحه متن و تصویر ترکیبی، پنجره زمینه ۱۱۰هزار توکنی را بهطور کامل استفاده خواهد کرد.
راهبردهای جستجو بر اساس نوع مدل
هر دو مدلهای سری GPT و سری o از بارگذاری فایل پشتیبانی میکنند و از منطق یکسانی برای گنجاندن زمینه و جاسازی جستجو استفاده میکنند. همه مدلها جستجوهای ترکیبی را روی یک نمایه جستجوی خصوصی اجرا میکنند و روشهای کلیدواژهای و معنایی را با هم ترکیب میکنند. در یک جستجوی ترکیبی، مدل بر اساس اعلان کاربر یک عبارت جستجو تولید میکند و نمایه جستجوی خصوصی متنها و تصاویر مرتبط را مطابق آن بازیابی میکند.
با این حال، این مدلها در نحوه جستجو در اسناد بزرگی که از پنجره زمینه فراتر میروند متفاوتاند:
مدلهای سری GPT
یک جستجو برای هر اعلان: مدلهای سری GPT برای هر اعلان کاربر یک جستجو انجام میدهند.
موارد استفاده مؤثر: ایدهآل برای پاسخ به پرسشهای سادهای که در مستندات گسترده گنجانده شدهاند.
نمونه پرسوجوها:
«سیاست منابع انسانی برای بازنشستگی زودهنگام چیست؟»
«تابع
process_orderچه کاری انجام میدهد؟»
مدلهای سری o
چند جستجو برای هر اعلان: میتواند برای هر اعلان کاربر چند جستجو (معمولاً ۲ تا ۳) اجرا کند که هرکدام عبارت جستجوی منحصربهفردی دارند. جستجوها بهصورت ترتیبی اجرا میشوند و مدل میتواند رویکرد خود را بر اساس اطلاعات بازیابیشده در جستجوهای قبلی بهروزرسانی کند.
موارد استفاده مؤثر: برای پرسشهای پیچیدهای مناسبتر است که به چند جستجوی هدفمند در مستندات گسترده نیاز دارند.
نمونه پرسوجوها:
«سیاستهای منابع انسانی برای بازنشستگی زودهنگام، مرخصی والدین و انتقال به خارج از کشور چیست؟»
«توضیح دهید تابع
process_orderچه کاری انجام میدهد، همه روشهایی را که این تابع فراخوانی میکند فهرست کنید و هر روش فراخوانیشده را بهاختصار شرح دهید.»
با وجود نقاط قوتشان، مدلهای سری o ممکن است وقتی یک پرسوجو به بیش از سه جستجو نیاز دارد دچار مشکل شوند.
نکاتی برای بهبود نتایج جستجوی فایل
برای پرسشهای پیچیدهای که به چند جستجو نیاز دارند، استفاده از یک مدل سری o را امتحان کنید.
به یاد داشته باشید پاسخها ممکن است بسته به نوع، تعداد و اندازه اسنادی که بارگذاری میکنید متفاوت باشند.
بهطور کلی، بارگذاری تعداد کمتری سند متمرکز به دقت بالاتر منجر میشود.
موضوعات چندپرسشی را به پرسشهای تکی تبدیل کنید:
اگر لازم است سیاستهای منابع انسانی هر ایالت را بدانید، آنها را یکییکی بپرسید.
اگر لازم است اسناد زیادی را خلاصه کنید، هر بار برای یک سند درخواست بدهید. اگر آن سند چند صد صفحه است، در نظر بگیرید آن را به اجزای کوچکتر تقسیم کنید.
اگر بهجای اسناد کامل، چند خلاصه به ChatGPT Enterprise داده باشید، میتوانید از آن بخواهید یک «خلاصهای از خلاصهها» بنویسد.
اگر یک CSV از یک RFP دارید (هر خط یک پرسش متفاوت است)، بهجای اینکه فقط CSV را بارگذاری کنید و یک پاسخ واحد بخواهید، آن پرسشها را یکییکی بپرسید.
راههایی برای ممیزی پاسخهای مدل پیدا کنید. نمونه دستورالعملهای GPT در ادامه آمده است:
# زمینه
شما در فهم اسناد خبره هستید. کاربر قرار است یک سند پیوست کند و یک سؤال بپرسد. او باید بتواند پاسخ شما را به بخش دقیق متن که پاسخ را از آن برداشتهاید ربط دهد.
# دستورالعملها
1. بر اساس سند پیوستشده کاربر و با استفاده از قالب دقیق زیر به سؤال او پاسخ دهید
# قالب
- سؤال: { سؤال کاربر را تکرار کنید }
- پاسخ: { به سؤال کاربر پاسخ دهید }
منبع:
- - شماره بخش: { شماره بخشی را که پاسخ را از آن گرفتهاید ارائه کنید }
- - عنوان بخش: { عنوان بخشی را که پاسخ را از آن گرفتهاید ارائه کنید }
- - متن دقیق: { متن دقیقی را که پاسخ را از آن گرفتهاید ارائه کنید }
# قوانین
- پاسخها را روشن و مختصر ارائه کنید
- فقط اطلاعاتی را ارائه کنید که در سند آمده است
- اگر نمیتوانید پاسخ را در سند پیدا کنید، فقط اینگونه پاسخ دهید: «هیچ اطلاعاتی یافت نشد.»