OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

بهینه‌سازی بارگذاری فایل در ChatGPT Enterprise

درک کنید قابلیت‌های ChatGPT Enterprise بر اساس نوع، تعداد و اندازه فایل چگونه با فایل‌ها کار می‌کنند. خروجی‌ها را بر پایه نیازهای فایل بهبود دهید.

به‌روزرسانی: 4 days ago

ChatGPT Enterprise اکنون از خواندن و درک عناصر بصری (تصاویر، نمودارها، دیاگرام‌ها و غیره) که در فایل‌های PDF موجود در اعلان‌ها جاسازی شده‌اند پشتیبانی می‌کند. کاربران می‌توانند یک PDF بارگذاری کنند و ChatGPT می‌تواند متن و هر عنصر بصری داخل آن فایل را تفسیر کند.

برای جزئیات، پرسش‌های متداول بازیابی بصری با PDFها را ببینید.

ChatGPT Enterprise به شما امکان می‌دهد فایل‌ها را به چند روش بارگذاری کنید:

این راهنما توضیح می‌دهد قابلیت‌های ChatGPT Enterprise چگونه بر اساس نوع، تعداد و اندازه فایل‌ها با آن‌ها کار می‌کنند و راهکارهایی را برای بهبود خروجی‌ها متناسب با الزامات فایل ارائه می‌دهد.

خلاصه

ChatGPT Enterprise با انواع فایل‌ها به روش‌های بسیار متفاوتی کار می‌کند: متن را از اسناد متنی مانند فایل‌های PDF، ارائه‌ها و Word استخراج می‌کند، داده‌های ساختاریافته صفحات گسترده را با کد Python تحلیل می‌کند و فایل‌های تصویری را از طریق GPT-Vision توصیف می‌کند. برای دستیابی به نتیجه مورد انتظار، باید بدانید هر نوع فایل کدام گردش کار را فعال می‌کند.

ChatGPT Enterprise برای اسناد متنی، تا حد امکان متن مرتبط را مستقیماً در کنار اعلان قرار می‌دهد و برای دسترسی به اطلاعات بیشتر از یک سامانه جست‌وجو استفاده می‌کند. این روش برای پاسخ‌دادن به پرسش‌های مشخص عملکرد خوبی دارد. بااین‌حال، این رویکرد ممکن است در انجام کارهای پیچیده‌ای مانند خلاصه‌کردن اسناد بسیار حجیم یا مقایسه چند فایل بزرگ با مشکل مواجه شود. برای آشنایی با راهکارهای بهبود نتایج، ادامه مطلب را بخوانید.

کار با فایل‌ها بر اساس نوع آن‌ها

ChatGPT Enterprise فایل‌ها را به سه روش اصلی پردازش می‌کند: استخراج متن، تحلیل کد و تفسیر تصویر. نوع فایل تعیین می‌کند ChatGPT Enterprise از کدام گردش کار استفاده کند.

بازیابی مبتنی بر متنمفسر کدپردازش تصویربازیابی بصری
نمونه انواع فایلpptx، docx، txt، md، json، xml، pdf*
* فایل‌های PDF بارگذاری‌شده به‌عنوان

دانش GPT
یا

فایل‌های پروژه
csv، xls، xlsx*
*توجه: مفسر کد می‌تواند با هر نوع فایلی کار کند، اما ChatGPT Enterprise معمولاً برای صفحات گسترده به‌طور پیش‌فرض از مفسر کد استفاده می‌کند
jpg، pngpdf*
* فایل‌های PDF موجود در اعلان‌های کاربر
نحوه عملکردمتن را از فایل استخراج می‌کند؛ بخشی از متن مستقیماً در پنجره زمینه قرار می‌گیرد («گنجانده می‌شود») و بخشی برای جست‌وجو ذخیره می‌شودمفسر کد فایل را برای پردازش به Python می‌فرستدتصاویر با رعایت

محدودیت‌های شناخته‌شده
، مستقیماً توسط مدل‌های چند مدال تفسیر می‌شوند.
ترکیبی از بازیابی متن و پردازش تصویر. متن به‌صورت دیجیتال استخراج می‌شود و محتوای بصری را مدل‌های چند مدال مستقیماً تفسیر می‌کنند.

برای فایل‌های صرفاً متنی، فایل‌های تصویری یا فایل‌های داده با ساختار مشخص (برای مثال، جدول تراکنش‌ها در Excel)، این دسته‌بندی‌ها بهترین عملکرد ممکن را ارائه می‌دهند.

موارد مبهمی نیز وجود دارند که چندان واضح نیستند؛ برای مثال:

  • تصاویر جاسازی‌شده در فایل‌هایی غیر از PDF پردازش نمی‌شوند. برای درنظرگرفتن این تصاویر، پیش از بارگذاری فایل را به PDF تبدیل کنید.

  • ChatGPT Enterprise برای کار با صفحات گسترده همیشه از مفسر کد استفاده می‌کند، حتی اگر سند حاوی متن زیادی باشد. برای مثال، اگر از ChatGPT Enterprise بخواهید یک فایل CSV حاوی ۱۰ ردیف متن را ترجمه کند، می‌کوشد این کار را با استفاده از یک کتابخانه Python انجام دهد؛ این روش از ترجمه مستقیم توسط مدل دقت کمتری دارد. برای کاهش این مشکل، صفحه گسترده را به قالبی مبتنی بر متن، مانند PDF، صادر کنید.

  • به همین ترتیب، اگر یک جدول ساختاریافته تراکنش‌ها را در قالب فایل JSON بارگذاری کنید، ChatGPT Enterprise آن را به‌صورت متن ساده تفسیر می‌کند. اگر می‌خواهید داده‌های موجود در فایل JSON را تحلیل کنید، در اعلان خود به مدل دستور دهید از مفسر کد استفاده کند.

مدیریت فایل‌ها بر اساس اندازه

ChatGPT Enterprise از مدل‌هایی با حداکثر پنجره زمینه ۱۲۸هزار توکن (تقریباً ۲۰۰ صفحه متن) استفاده می‌کند. با این حال، همه توکن‌ها برای گنجاندن متن فایل‌های بارگذاری‌شده استفاده نمی‌شوند. تعداد توکن‌های «گنجانده‌شده» بسته به نوع استفاده متفاوت است.

ChatGPT Enterprise مقداری از متن را «می‌گنجاند» و متن باقی‌مانده به یک نمایه جستجوی خصوصی ارسال می‌شود (یک «ذخیره‌ساز برداری» که نوعی پایگاه داده است و برای ذخیره و بازیابی کارآمد حجم زیادی از متن طراحی شده است). وقتی پرسشی می‌پرسید، ChatGPT Enterprise متن گنجانده‌شده را همراه با بخش‌های مرتبطی که از یک نمایه جستجوی خصوصی بازیابی شده‌اند وارد می‌کند.

اگر یک سند واحد بارگذاری کنید، ChatGPT Enterprise متن را از ابتدای سند تا رسیدن به حد خود شامل می‌کند. اگر چند سند بارگذاری کنید، ChatGPT Enterprise بخشی یا تمام هر سند را شامل می‌کند. همه متن اسناد نیز به یک نمایه جستجوی خصوصی ارسال می‌شود.

گنجاندن زمینه برای اسناد متنی

این قابلیت در حال توسعه فعال است. بنابراین، جزئیات زیر ممکن است بدون اطلاع قبلی تغییر کنند.

ChatGPT Enterprise می‌تواند تا ۱۱۰هزار توکن از اسناد بارگذاری‌شده را در پنجره زمینه پردازش کند. اگر یک یا چند سند با مجموع کمتر از ۱۱۰هزار توکن بارگذاری کنید، کل محتوا گنجانده می‌شود.

برای یک سند واحد که بیش از ۱۱۰هزار توکن دارد، فقط نخستین ۱۱۰هزار توکن، از ابتدای سند، گنجانده می‌شود. باقی‌مانده فقط به نمایه جستجوی خصوصی ارسال می‌شود.

اگر چند سند بارگذاری شوند و مجموع آن‌ها از ۱۱۰هزار توکن فراتر رود، ChatGPT Enterprise برای متعادل کردن نمایش اسناد از یک فرایند دو مرحله‌ای استفاده می‌کند:

  1. تا ۵۵هزار توکن را استخراج کنید که به‌طور برابر میان اسناد بارگذاری‌شده تقسیم می‌شود.

  1. برای اسنادی که در مرحله اول به‌طور کامل نمایش داده نشده‌اند، ۵۵هزار توکن باقی‌مانده را بر اساس توکن‌های باقی‌مانده در هر سند، به‌صورت متناسب اختصاص دهید.

  1. هر توکن باقی‌مانده فقط به نمایه جستجوی خصوصی ارسال می‌شود.

می‌توانید با کپی کردن متن سند در توکنیزه‌کننده OpenAI تعداد توکن‌های یک سند متنی را برآورد کنید.

گنجاندن زمینه برای PDFهای چندرسانه‌ای

وقتی کاربران PDFهایی را بارگذاری می‌کنند که هم متن و هم تصویر دارند، بازیابی بصری به ChatGPT امکان می‌دهد این تصاویر را همراه با متن استخراج‌شده دیجیتالی، به‌صورت بومی پردازش کند. مراحل زیر رویه‌های استاندارد ما برای مدیریت زمینه در PDFهای چندرسانه‌ای را تکمیل می‌کنند:

  • استخراج و جاسازی تصویر: تصاویر همراه با متن دیجیتال مرتبطشان استخراج و جاسازی می‌شوند.

  • مقیاس‌بندی هوشمند: تصاویر به‌طور خودکار مقیاس‌بندی می‌شوند تا میان کیفیت اطلاعات و استفاده کارآمد از پنجره زمینه موجود تعادل برقرار شود.

وقتی PDFهای بارگذاری‌شده از حد ۱۱۰هزار توکن فراتر می‌روند، هم تصاویر و هم متن در نمایه جستجوی خصوصی جاسازی می‌شوند. جاسازی‌های متن به تصاویر مرتبط ارجاع می‌دهند و به ChatGPT امکان می‌دهند بر اساس پرس‌وجوهای کاربر، جفت‌های متن-تصویر مناسب را بازیابی کند. سپس تصاویر بازیابی‌شده با استفاده از قابلیت‌های چند مدال بومی ChatGPT پردازش می‌شوند.

برآورد دقیق نیازمندی‌های توکن برای PDFهای چندرسانه‌ای دشوار است. آزمایش‌ها نشان می‌دهد که حدود ۳۵۰ صفحه متن و تصویر ترکیبی، پنجره زمینه ۱۱۰هزار توکنی را به‌طور کامل استفاده خواهد کرد.

راهبردهای جستجو بر اساس نوع مدل

هر دو مدل‌های سری GPT و سری o از بارگذاری فایل پشتیبانی می‌کنند و از منطق یکسانی برای گنجاندن زمینه و جاسازی جستجو استفاده می‌کنند. همه مدل‌ها جستجوهای ترکیبی را روی یک نمایه جستجوی خصوصی اجرا می‌کنند و روش‌های کلیدواژه‌ای و معنایی را با هم ترکیب می‌کنند. در یک جستجوی ترکیبی، مدل بر اساس اعلان کاربر یک عبارت جستجو تولید می‌کند و نمایه جستجوی خصوصی متن‌ها و تصاویر مرتبط را مطابق آن بازیابی می‌کند.

با این حال، این مدل‌ها در نحوه جستجو در اسناد بزرگی که از پنجره زمینه فراتر می‌روند متفاوت‌اند:

مدل‌های سری GPT

  • یک جست‌وجو برای هر اعلان: مدل‌های سری GPT برای هر اعلان کاربر یک جست‌وجو انجام می‌دهند.

  • کاربردهای مناسب: برای پاسخ‌دادن به پرسش‌های ساده‌ای که پاسخشان در مستندات گسترده قرار دارد، ایدئال است.

نمونه پرسش‌ها:

  • «سیاست منابع انسانی درباره بازنشستگی پیش از موعد چیست؟»

  • «تابع process_order چه کاری انجام می‌دهد؟»

مدل‌های سری o

  • چند جست‌وجو برای هر اعلان: می‌تواند برای هر اعلان کاربر چند جست‌وجو (معمولاً ۲ تا ۳ مورد) انجام دهد که هرکدام عبارت جست‌وجوی منحصربه‌فردی دارند. جست‌وجوها به‌ترتیب انجام می‌شوند و مدل می‌تواند رویکرد خود را بر اساس اطلاعات به‌دست‌آمده از جست‌وجوهای قبلی تغییر دهد.

  • کاربردهای مناسب: برای پرسش‌های پیچیده‌ای مناسب‌تر است که به چند جست‌وجوی هدفمند در مستندات گسترده نیاز دارند.

نمونه پرسش‌ها:

  • «سیاست‌های منابع انسانی درباره بازنشستگی پیش از موعد، مرخصی والدین و انتقال به خارج از کشور چیست؟»

  • «توضیح دهید تابع process_order چه کاری انجام می‌دهد، همه متدهایی را که این تابع فراخوانی می‌کند فهرست کنید و هر متد فراخوانی‌شده را به‌اختصار شرح دهید.»

مدل‌های سری o با وجود نقاط قوتشان، ممکن است در پرسش‌هایی که به بیش از سه جست‌وجو نیاز دارند با مشکل مواجه شوند.

نکاتی برای بهبود نتایج جستجوی فایل

  • برای پرسش‌های پیچیده‌ای که به چند جستجو نیاز دارند، استفاده از یک مدل سری o را امتحان کنید.

  • به یاد داشته باشید پاسخ‌ها ممکن است بسته به نوع، تعداد و اندازه اسنادی که بارگذاری می‌کنید متفاوت باشند.

  • به‌طور کلی، بارگذاری تعداد کمتری سند متمرکز به دقت بالاتر منجر می‌شود.

  • موضوعات چندپرسشی را به پرسش‌های تکی تبدیل کنید:

    • اگر لازم است سیاست‌های منابع انسانی هر ایالت را بدانید، آن‌ها را یکی‌یکی بپرسید.

    • اگر لازم است اسناد زیادی را خلاصه کنید، هر بار برای یک سند درخواست بدهید. اگر آن سند چند صد صفحه است، در نظر بگیرید آن را به اجزای کوچک‌تر تقسیم کنید.

      • اگر به‌جای اسناد کامل، چند خلاصه به ChatGPT Enterprise داده باشید، می‌توانید از آن بخواهید یک «خلاصه‌ای از خلاصه‌ها» بنویسد.

    • اگر یک CSV از یک RFP دارید (هر خط یک پرسش متفاوت است)، به‌جای اینکه فقط CSV را بارگذاری کنید و یک پاسخ واحد بخواهید، آن پرسش‌ها را یکی‌یکی بپرسید.

  • راه‌هایی برای ممیزی پاسخ‌های مدل پیدا کنید. نمونه دستورالعمل‌های GPT در ادامه آمده است:

# زمینه 

شما در فهم اسناد خبره هستید. کاربر قرار است یک سند پیوست کند و یک سؤال بپرسد. او باید بتواند پاسخ شما را به بخش دقیق متن که پاسخ را از آن برداشته‌اید ربط دهد.

# دستورالعمل‌ها

1. بر اساس سند پیوست‌شده کاربر و با استفاده از قالب دقیق زیر به سؤال او پاسخ دهید

# قالب

- سؤال: { سؤال کاربر را تکرار کنید }
- پاسخ: { به سؤال کاربر پاسخ دهید }
منبع:
- - شماره بخش: { شماره بخشی را که پاسخ را از آن گرفته‌اید ارائه کنید }
- - عنوان بخش: { عنوان بخشی را که پاسخ را از آن گرفته‌اید ارائه کنید }
- - متن دقیق: { متن دقیقی را که پاسخ را از آن گرفته‌اید ارائه کنید }

# قوانین

- پاسخ‌ها را روشن و مختصر ارائه کنید
- فقط اطلاعاتی را ارائه کنید که در سند آمده است
- اگر نمی‌توانید پاسخ را در سند پیدا کنید، فقط این‌گونه پاسخ دهید: «هیچ اطلاعاتی یافت نشد.»

آیا این مقاله مفید بود؟