ChatGPT Enterprise اکنون از خواندن و درک عناصر بصری (تصاویر، نمودارها، دیاگرامها و غیره) که در فایلهای PDF موجود در اعلانها جاسازی شدهاند پشتیبانی میکند. کاربران میتوانند یک PDF بارگذاری کنند و ChatGPT میتواند متن و هر عنصر بصری داخل آن فایل را تفسیر کند.
برای جزئیات، پرسشهای متداول بازیابی بصری با PDFها را ببینید.
ChatGPT Enterprise به شما امکان میدهد فایلها را به چند روش بارگذاری کنید:
مستقیماً از رایانهتان
بهعنوان دانش GPT
بهعنوان فایل پروژه
از طریق یک اقدام GPT
این راهنما توضیح میدهد قابلیتهای ChatGPT Enterprise چگونه بر اساس نوع، تعداد و اندازه فایلها با آنها کار میکنند و راهکارهایی را برای بهبود خروجیها متناسب با الزامات فایل ارائه میدهد.
خلاصه
ChatGPT Enterprise با انواع فایلها به روشهای بسیار متفاوتی کار میکند: متن را از اسناد متنی مانند فایلهای PDF، ارائهها و Word استخراج میکند، دادههای ساختاریافته صفحات گسترده را با کد Python تحلیل میکند و فایلهای تصویری را از طریق GPT-Vision توصیف میکند. برای دستیابی به نتیجه مورد انتظار، باید بدانید هر نوع فایل کدام گردش کار را فعال میکند.
ChatGPT Enterprise برای اسناد متنی، تا حد امکان متن مرتبط را مستقیماً در کنار اعلان قرار میدهد و برای دسترسی به اطلاعات بیشتر از یک سامانه جستوجو استفاده میکند. این روش برای پاسخدادن به پرسشهای مشخص عملکرد خوبی دارد. بااینحال، این رویکرد ممکن است در انجام کارهای پیچیدهای مانند خلاصهکردن اسناد بسیار حجیم یا مقایسه چند فایل بزرگ با مشکل مواجه شود. برای آشنایی با راهکارهای بهبود نتایج، ادامه مطلب را بخوانید.
کار با فایلها بر اساس نوع آنها
ChatGPT Enterprise فایلها را به سه روش اصلی پردازش میکند: استخراج متن، تحلیل کد و تفسیر تصویر. نوع فایل تعیین میکند ChatGPT Enterprise از کدام گردش کار استفاده کند.
| بازیابی مبتنی بر متن | مفسر کد | پردازش تصویر | بازیابی بصری | |
|---|---|---|---|---|
| نمونه انواع فایل | pptx، docx، txt، md، json، xml، pdf* * فایلهای PDF بارگذاریشده بهعنوان دانش GPT یا فایلهای پروژه | csv، xls، xlsx* *توجه: مفسر کد میتواند با هر نوع فایلی کار کند، اما ChatGPT Enterprise معمولاً برای صفحات گسترده بهطور پیشفرض از مفسر کد استفاده میکند | jpg، png | pdf* * فایلهای PDF موجود در اعلانهای کاربر |
| نحوه عملکرد | متن را از فایل استخراج میکند؛ بخشی از متن مستقیماً در پنجره زمینه قرار میگیرد («گنجانده میشود») و بخشی برای جستوجو ذخیره میشود | مفسر کد فایل را برای پردازش به Python میفرستد | تصاویر با رعایت محدودیتهای شناختهشده ، مستقیماً توسط مدلهای چند مدال تفسیر میشوند. | ترکیبی از بازیابی متن و پردازش تصویر. متن بهصورت دیجیتال استخراج میشود و محتوای بصری را مدلهای چند مدال مستقیماً تفسیر میکنند. |
برای فایلهای صرفاً متنی، فایلهای تصویری یا فایلهای داده با ساختار مشخص (برای مثال، جدول تراکنشها در Excel)، این دستهبندیها بهترین عملکرد ممکن را ارائه میدهند.
موارد مبهمی نیز وجود دارند که چندان واضح نیستند؛ برای مثال:
تصاویر جاسازیشده در فایلهایی غیر از PDF پردازش نمیشوند. برای درنظرگرفتن این تصاویر، پیش از بارگذاری فایل را به PDF تبدیل کنید.
ChatGPT Enterprise برای کار با صفحات گسترده همیشه از مفسر کد استفاده میکند، حتی اگر سند حاوی متن زیادی باشد. برای مثال، اگر از ChatGPT Enterprise بخواهید یک فایل CSV حاوی ۱۰ ردیف متن را ترجمه کند، میکوشد این کار را با استفاده از یک کتابخانه Python انجام دهد؛ این روش از ترجمه مستقیم توسط مدل دقت کمتری دارد. برای کاهش این مشکل، صفحه گسترده را به قالبی مبتنی بر متن، مانند PDF، صادر کنید.
به همین ترتیب، اگر یک جدول ساختاریافته تراکنشها را در قالب فایل JSON بارگذاری کنید، ChatGPT Enterprise آن را بهصورت متن ساده تفسیر میکند. اگر میخواهید دادههای موجود در فایل JSON را تحلیل کنید، در اعلان خود به مدل دستور دهید از مفسر کد استفاده کند.
مدیریت فایلها بر اساس اندازه
ChatGPT Enterprise از مدلهایی با حداکثر پنجره زمینه ۱۲۸هزار توکن (تقریباً ۲۰۰ صفحه متن) استفاده میکند. با این حال، همه توکنها برای گنجاندن متن فایلهای بارگذاریشده استفاده نمیشوند. تعداد توکنهای «گنجاندهشده» بسته به نوع استفاده متفاوت است.
ChatGPT Enterprise مقداری از متن را «میگنجاند» و متن باقیمانده به یک نمایه جستجوی خصوصی ارسال میشود (یک «ذخیرهساز برداری» که نوعی پایگاه داده است و برای ذخیره و بازیابی کارآمد حجم زیادی از متن طراحی شده است). وقتی پرسشی میپرسید، ChatGPT Enterprise متن گنجاندهشده را همراه با بخشهای مرتبطی که از یک نمایه جستجوی خصوصی بازیابی شدهاند وارد میکند.
اگر یک سند واحد بارگذاری کنید، ChatGPT Enterprise متن را از ابتدای سند تا رسیدن به حد خود شامل میکند. اگر چند سند بارگذاری کنید، ChatGPT Enterprise بخشی یا تمام هر سند را شامل میکند. همه متن اسناد نیز به یک نمایه جستجوی خصوصی ارسال میشود.
گنجاندن زمینه برای اسناد متنی
این قابلیت در حال توسعه فعال است. بنابراین، جزئیات زیر ممکن است بدون اطلاع قبلی تغییر کنند.
ChatGPT Enterprise میتواند تا ۱۱۰هزار توکن از اسناد بارگذاریشده را در پنجره زمینه پردازش کند. اگر یک یا چند سند با مجموع کمتر از ۱۱۰هزار توکن بارگذاری کنید، کل محتوا گنجانده میشود.
برای یک سند واحد که بیش از ۱۱۰هزار توکن دارد، فقط نخستین ۱۱۰هزار توکن، از ابتدای سند، گنجانده میشود. باقیمانده فقط به نمایه جستجوی خصوصی ارسال میشود.
اگر چند سند بارگذاری شوند و مجموع آنها از ۱۱۰هزار توکن فراتر رود، ChatGPT Enterprise برای متعادل کردن نمایش اسناد از یک فرایند دو مرحلهای استفاده میکند:
تا ۵۵هزار توکن را استخراج کنید که بهطور برابر میان اسناد بارگذاریشده تقسیم میشود.
برای اسنادی که در مرحله اول بهطور کامل نمایش داده نشدهاند، ۵۵هزار توکن باقیمانده را بر اساس توکنهای باقیمانده در هر سند، بهصورت متناسب اختصاص دهید.
هر توکن باقیمانده فقط به نمایه جستجوی خصوصی ارسال میشود.
میتوانید با کپی کردن متن سند در توکنیزهکننده OpenAI تعداد توکنهای یک سند متنی را برآورد کنید.
گنجاندن زمینه برای PDFهای چندرسانهای
وقتی کاربران PDFهایی را بارگذاری میکنند که هم متن و هم تصویر دارند، بازیابی بصری به ChatGPT امکان میدهد این تصاویر را همراه با متن استخراجشده دیجیتالی، بهصورت بومی پردازش کند. مراحل زیر رویههای استاندارد ما برای مدیریت زمینه در PDFهای چندرسانهای را تکمیل میکنند:
استخراج و جاسازی تصویر: تصاویر همراه با متن دیجیتال مرتبطشان استخراج و جاسازی میشوند.
مقیاسبندی هوشمند: تصاویر بهطور خودکار مقیاسبندی میشوند تا میان کیفیت اطلاعات و استفاده کارآمد از پنجره زمینه موجود تعادل برقرار شود.
وقتی PDFهای بارگذاریشده از حد ۱۱۰هزار توکن فراتر میروند، هم تصاویر و هم متن در نمایه جستجوی خصوصی جاسازی میشوند. جاسازیهای متن به تصاویر مرتبط ارجاع میدهند و به ChatGPT امکان میدهند بر اساس پرسوجوهای کاربر، جفتهای متن-تصویر مناسب را بازیابی کند. سپس تصاویر بازیابیشده با استفاده از قابلیتهای چند مدال بومی ChatGPT پردازش میشوند.
برآورد دقیق نیازمندیهای توکن برای PDFهای چندرسانهای دشوار است. آزمایشها نشان میدهد که حدود ۳۵۰ صفحه متن و تصویر ترکیبی، پنجره زمینه ۱۱۰هزار توکنی را بهطور کامل استفاده خواهد کرد.
راهبردهای جستجو بر اساس نوع مدل
هر دو مدلهای سری GPT و سری o از بارگذاری فایل پشتیبانی میکنند و از منطق یکسانی برای گنجاندن زمینه و جاسازی جستجو استفاده میکنند. همه مدلها جستجوهای ترکیبی را روی یک نمایه جستجوی خصوصی اجرا میکنند و روشهای کلیدواژهای و معنایی را با هم ترکیب میکنند. در یک جستجوی ترکیبی، مدل بر اساس اعلان کاربر یک عبارت جستجو تولید میکند و نمایه جستجوی خصوصی متنها و تصاویر مرتبط را مطابق آن بازیابی میکند.
با این حال، این مدلها در نحوه جستجو در اسناد بزرگی که از پنجره زمینه فراتر میروند متفاوتاند:
مدلهای سری GPT
یک جستوجو برای هر اعلان: مدلهای سری GPT برای هر اعلان کاربر یک جستوجو انجام میدهند.
کاربردهای مناسب: برای پاسخدادن به پرسشهای سادهای که پاسخشان در مستندات گسترده قرار دارد، ایدئال است.
نمونه پرسشها:
«سیاست منابع انسانی درباره بازنشستگی پیش از موعد چیست؟»
«تابع process_order چه کاری انجام میدهد؟»
مدلهای سری o
چند جستوجو برای هر اعلان: میتواند برای هر اعلان کاربر چند جستوجو (معمولاً ۲ تا ۳ مورد) انجام دهد که هرکدام عبارت جستوجوی منحصربهفردی دارند. جستوجوها بهترتیب انجام میشوند و مدل میتواند رویکرد خود را بر اساس اطلاعات بهدستآمده از جستوجوهای قبلی تغییر دهد.
کاربردهای مناسب: برای پرسشهای پیچیدهای مناسبتر است که به چند جستوجوی هدفمند در مستندات گسترده نیاز دارند.
نمونه پرسشها:
«سیاستهای منابع انسانی درباره بازنشستگی پیش از موعد، مرخصی والدین و انتقال به خارج از کشور چیست؟»
«توضیح دهید تابع process_order چه کاری انجام میدهد، همه متدهایی را که این تابع فراخوانی میکند فهرست کنید و هر متد فراخوانیشده را بهاختصار شرح دهید.»
مدلهای سری o با وجود نقاط قوتشان، ممکن است در پرسشهایی که به بیش از سه جستوجو نیاز دارند با مشکل مواجه شوند.
نکاتی برای بهبود نتایج جستجوی فایل
برای پرسشهای پیچیدهای که به چند جستجو نیاز دارند، استفاده از یک مدل سری o را امتحان کنید.
به یاد داشته باشید پاسخها ممکن است بسته به نوع، تعداد و اندازه اسنادی که بارگذاری میکنید متفاوت باشند.
بهطور کلی، بارگذاری تعداد کمتری سند متمرکز به دقت بالاتر منجر میشود.
موضوعات چندپرسشی را به پرسشهای تکی تبدیل کنید:
اگر لازم است سیاستهای منابع انسانی هر ایالت را بدانید، آنها را یکییکی بپرسید.
اگر لازم است اسناد زیادی را خلاصه کنید، هر بار برای یک سند درخواست بدهید. اگر آن سند چند صد صفحه است، در نظر بگیرید آن را به اجزای کوچکتر تقسیم کنید.
اگر بهجای اسناد کامل، چند خلاصه به ChatGPT Enterprise داده باشید، میتوانید از آن بخواهید یک «خلاصهای از خلاصهها» بنویسد.
اگر یک CSV از یک RFP دارید (هر خط یک پرسش متفاوت است)، بهجای اینکه فقط CSV را بارگذاری کنید و یک پاسخ واحد بخواهید، آن پرسشها را یکییکی بپرسید.
راههایی برای ممیزی پاسخهای مدل پیدا کنید. نمونه دستورالعملهای GPT در ادامه آمده است:
# زمینه
شما در فهم اسناد خبره هستید. کاربر قرار است یک سند پیوست کند و یک سؤال بپرسد. او باید بتواند پاسخ شما را به بخش دقیق متن که پاسخ را از آن برداشتهاید ربط دهد.
# دستورالعملها
1. بر اساس سند پیوستشده کاربر و با استفاده از قالب دقیق زیر به سؤال او پاسخ دهید
# قالب
- سؤال: { سؤال کاربر را تکرار کنید }
- پاسخ: { به سؤال کاربر پاسخ دهید }
منبع:
- - شماره بخش: { شماره بخشی را که پاسخ را از آن گرفتهاید ارائه کنید }
- - عنوان بخش: { عنوان بخشی را که پاسخ را از آن گرفتهاید ارائه کنید }
- - متن دقیق: { متن دقیقی را که پاسخ را از آن گرفتهاید ارائه کنید }
# قوانین
- پاسخها را روشن و مختصر ارائه کنید
- فقط اطلاعاتی را ارائه کنید که در سند آمده است
- اگر نمیتوانید پاسخ را در سند پیدا کنید، فقط اینگونه پاسخ دهید: «هیچ اطلاعاتی یافت نشد.»