OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

بهینه‌سازی بارگذاری فایل در ChatGPT Enterprise

درک کنید قابلیت‌های ChatGPT Enterprise بر اساس نوع، تعداد و اندازه فایل چگونه با فایل‌ها کار می‌کنند. خروجی‌ها را بر پایه نیازهای فایل بهبود دهید.

به‌روزرسانی: 11 days ago

ChatGPT Enterprise اکنون از خواندن و درک عناصر بصری (تصاویر، نمودارها، دیاگرام‌ها و غیره) که در فایل‌های PDF موجود در اعلان‌ها جاسازی شده‌اند پشتیبانی می‌کند. کاربران می‌توانند یک PDF بارگذاری کنند و ChatGPT می‌تواند متن و هر عنصر بصری داخل آن فایل را تفسیر کند.

برای جزئیات، پرسش‌های متداول بازیابی بصری با PDFها را ببینید.

ChatGPT Enterprise به شما امکان می‌دهد فایل‌ها را به چند روش بارگذاری کنید:

این راهنما توضیح می‌دهد قابلیت‌های ChatGPT Enterprise چگونه فایل‌ها را بر اساس نوع، تعداد و اندازه‌شان مدیریت می‌کنند و راهبردهایی را برای بهبود خروجی‌ها بر اساس نیازمندی‌های فایل مطرح می‌کند.

خلاصه

ChatGPT Enterprise با انواع مختلف فایل بسیار متفاوت برخورد می‌کند: استخراج متن از اسناد متنی مانند PDFها، ارائه‌ها و فایل‌های Word، تحلیل داده‌های ساختاریافته از صفحه‌گسترده‌ها با استفاده از کد Python، و توصیف فایل‌های تصویری از طریق GPT-Vision. درک اینکه کدام نوع فایل کدام گردش‌کار را فعال می‌کند، برای رسیدن به نتیجه مورد انتظار کلیدی است.

برای اسناد مبتنی بر متن، ChatGPT Enterprise تا حد امکان متن مرتبط را مستقیماً در کنار اعلان می‌گنجاند و از یک سیستم جستجو برای دسترسی به اطلاعات بیشتر استفاده می‌کند. این روش برای پاسخ به پرسش‌های مشخص خوب عمل می‌کند. با این حال، این رویکرد می‌تواند در کارهای پیچیده‌ای مانند خلاصه‌سازی اسناد بسیار بزرگ یا مقایسه چند فایل بزرگ با مشکل روبه‌رو شود. برای آشنایی با راهبردهای بهبود نتایج خود، ادامه مطلب را بخوانید.

مدیریت فایل‌ها بر اساس نوع

ChatGPT Enterprise فایل‌ها را به سه روش اصلی پردازش می‌کند: استخراج متن، تحلیل کد و تفسیر تصویر. نوع فایل تعیین می‌کند ChatGPT Enterprise کدام گردش‌کار را دنبال کند.

بازیابی مبتنی بر متنمفسر کدپردازش تصویربازیابی بصری
نمونه‌های نوع فایلpptx، docx، txt، md، json، xml، pdf*
* PDFهایی که به‌عنوان

دانش GPT
یا

فایل‌های پروژه
بارگذاری شده‌اند
csv، xls، xlsx*
*توجه: مفسر کد می‌تواند روی هر نوع فایلی کار کند، اما ChatGPT Enterprise معمولاً به‌طور پیش‌فرض برای صفحه‌گسترده‌ها از CI استفاده می‌کند
jpg، pngpdf*
* PDFهای گنجانده‌شده در اعلان‌های کاربر
رفتارمتن را از فایل استخراج می‌کند؛ بخشی از متن مستقیماً در پنجره زمینه چسبانده («گنجانده») می‌شود و بخشی از متن برای جستجو ذخیره می‌شودمفسر کد فایل را برای پردازش به Python می‌سپاردتصاویر به‌صورت بومی توسط مدل‌های چند مدال تفسیر می‌شوند، با توجه به

محدودیت‌های شناخته‌شده
.
ترکیبی از بازیابی متن و پردازش تصویر. متن به‌صورت دیجیتال استخراج می‌شود و محتوای بصری به‌صورت بومی توسط مدل‌های چند مدال تفسیر می‌شود.

برای فایل‌های فقط متنی، فایل‌های تصویری یا فایل‌های داده با ساختار واضح (مثلاً یک جدول Excel از تراکنش‌ها)، این تقسیم‌بندی‌ها بهترین رفتار ممکن را نشان می‌دهند.

برخی نواحی خاکستری وجود دارند که کمتر بدیهی‌اند، برای مثال:

  • تصاویر جاسازی‌شده در فایل‌هایی غیر از PDF پردازش نمی‌شوند. برای گنجاندن آن‌ها، پیش از بارگذاری فایل را به PDF تبدیل کنید.

  • ChatGPT Enterprise همیشه برای تعامل با صفحه‌گسترده‌ها از مفسر کد استفاده می‌کند، حتی اگر سند مقدار زیادی متن داشته باشد. برای مثال، اگر از ChatGPT Enterprise بخواهید یک فایل CSV با ۱۰ ردیف متن را ترجمه کند، تلاش می‌کند فایل را با استفاده از یک کتابخانه Python ترجمه کند که دقت کمتری نسبت به این دارد که به مدل اجازه دهید مستقیماً ترجمه تولید کند. برای کاهش این مشکل، صفحه‌گسترده را به یک قالب مبتنی بر متن (مثلاً PDF) صادر کنید.

  • به‌طور مشابه، اگر یک جدول تراکنشی ساختاریافته را که در یک فایل JSON توصیف شده است بارگذاری کنید، ChatGPT Enterprise این فایل را به‌عنوان متن ساده تفسیر خواهد کرد. اگر می‌خواهید داده‌های موجود در یک فایل JSON را تحلیل کنید، در اعلان خود به مدل دستور دهید از مفسر کد استفاده کند.

مدیریت فایل‌ها بر اساس اندازه

ChatGPT Enterprise از مدل‌هایی با حداکثر پنجره زمینه ۱۲۸هزار توکن (تقریباً ۲۰۰ صفحه متن) استفاده می‌کند. با این حال، همه توکن‌ها برای گنجاندن متن فایل‌های بارگذاری‌شده استفاده نمی‌شوند. تعداد توکن‌های «گنجانده‌شده» بسته به نوع استفاده متفاوت است.

ChatGPT Enterprise مقداری از متن را «می‌گنجاند» و متن باقی‌مانده به یک نمایه جستجوی خصوصی ارسال می‌شود (یک «ذخیره‌ساز برداری» که نوعی پایگاه داده است و برای ذخیره و بازیابی کارآمد حجم زیادی از متن طراحی شده است). وقتی پرسشی می‌پرسید، ChatGPT Enterprise متن گنجانده‌شده را همراه با بخش‌های مرتبطی که از یک نمایه جستجوی خصوصی بازیابی شده‌اند وارد می‌کند.

اگر یک سند واحد بارگذاری کنید، ChatGPT Enterprise متن را از ابتدای سند تا رسیدن به حد خود شامل می‌کند. اگر چند سند بارگذاری کنید، ChatGPT Enterprise بخشی یا تمام هر سند را شامل می‌کند. همه متن اسناد نیز به یک نمایه جستجوی خصوصی ارسال می‌شود.

گنجاندن زمینه برای اسناد متنی

این قابلیت در حال توسعه فعال است. بنابراین، جزئیات زیر ممکن است بدون اطلاع قبلی تغییر کنند.

ChatGPT Enterprise می‌تواند تا ۱۱۰هزار توکن از اسناد بارگذاری‌شده را در پنجره زمینه پردازش کند. اگر یک یا چند سند با مجموع کمتر از ۱۱۰هزار توکن بارگذاری کنید، کل محتوا گنجانده می‌شود.

برای یک سند واحد که بیش از ۱۱۰هزار توکن دارد، فقط نخستین ۱۱۰هزار توکن، از ابتدای سند، گنجانده می‌شود. باقی‌مانده فقط به نمایه جستجوی خصوصی ارسال می‌شود.

اگر چند سند بارگذاری شوند و مجموع آن‌ها از ۱۱۰هزار توکن فراتر رود، ChatGPT Enterprise برای متعادل کردن نمایش اسناد از یک فرایند دو مرحله‌ای استفاده می‌کند:

  1. تا ۵۵هزار توکن را استخراج کنید که به‌طور برابر میان اسناد بارگذاری‌شده تقسیم می‌شود.

  1. برای اسنادی که در مرحله اول به‌طور کامل نمایش داده نشده‌اند، ۵۵هزار توکن باقی‌مانده را بر اساس توکن‌های باقی‌مانده در هر سند، به‌صورت متناسب اختصاص دهید.

  1. هر توکن باقی‌مانده فقط به نمایه جستجوی خصوصی ارسال می‌شود.

می‌توانید با کپی کردن متن سند در توکنیزه‌کننده OpenAI تعداد توکن‌های یک سند متنی را برآورد کنید.

گنجاندن زمینه برای PDFهای چندرسانه‌ای

وقتی کاربران PDFهایی را بارگذاری می‌کنند که هم متن و هم تصویر دارند، بازیابی بصری به ChatGPT امکان می‌دهد این تصاویر را همراه با متن استخراج‌شده دیجیتالی، به‌صورت بومی پردازش کند. مراحل زیر رویه‌های استاندارد ما برای مدیریت زمینه در PDFهای چندرسانه‌ای را تکمیل می‌کنند:

  • استخراج و جاسازی تصویر: تصاویر همراه با متن دیجیتال مرتبطشان استخراج و جاسازی می‌شوند.

  • مقیاس‌بندی هوشمند: تصاویر به‌طور خودکار مقیاس‌بندی می‌شوند تا میان کیفیت اطلاعات و استفاده کارآمد از پنجره زمینه موجود تعادل برقرار شود.

وقتی PDFهای بارگذاری‌شده از حد ۱۱۰هزار توکن فراتر می‌روند، هم تصاویر و هم متن در نمایه جستجوی خصوصی جاسازی می‌شوند. جاسازی‌های متن به تصاویر مرتبط ارجاع می‌دهند و به ChatGPT امکان می‌دهند بر اساس پرس‌وجوهای کاربر، جفت‌های متن-تصویر مناسب را بازیابی کند. سپس تصاویر بازیابی‌شده با استفاده از قابلیت‌های چند مدال بومی ChatGPT پردازش می‌شوند.

برآورد دقیق نیازمندی‌های توکن برای PDFهای چندرسانه‌ای دشوار است. آزمایش‌ها نشان می‌دهد که حدود ۳۵۰ صفحه متن و تصویر ترکیبی، پنجره زمینه ۱۱۰هزار توکنی را به‌طور کامل استفاده خواهد کرد.

راهبردهای جستجو بر اساس نوع مدل

هر دو مدل‌های سری GPT و سری o از بارگذاری فایل پشتیبانی می‌کنند و از منطق یکسانی برای گنجاندن زمینه و جاسازی جستجو استفاده می‌کنند. همه مدل‌ها جستجوهای ترکیبی را روی یک نمایه جستجوی خصوصی اجرا می‌کنند و روش‌های کلیدواژه‌ای و معنایی را با هم ترکیب می‌کنند. در یک جستجوی ترکیبی، مدل بر اساس اعلان کاربر یک عبارت جستجو تولید می‌کند و نمایه جستجوی خصوصی متن‌ها و تصاویر مرتبط را مطابق آن بازیابی می‌کند.

با این حال، این مدل‌ها در نحوه جستجو در اسناد بزرگی که از پنجره زمینه فراتر می‌روند متفاوت‌اند:

مدل‌های سری GPT

  • یک جستجو برای هر اعلان: مدل‌های سری GPT برای هر اعلان کاربر یک جستجو انجام می‌دهند.

  • موارد استفاده مؤثر: ایده‌آل برای پاسخ به پرسش‌های ساده‌ای که در مستندات گسترده گنجانده شده‌اند.

نمونه پرس‌وجوها:

  • «سیاست منابع انسانی برای بازنشستگی زودهنگام چیست؟»

  • «تابع process_order چه کاری انجام می‌دهد؟»

مدل‌های سری o

  • چند جستجو برای هر اعلان: می‌تواند برای هر اعلان کاربر چند جستجو (معمولاً ۲ تا ۳) اجرا کند که هرکدام عبارت جستجوی منحصربه‌فردی دارند. جستجوها به‌صورت ترتیبی اجرا می‌شوند و مدل می‌تواند رویکرد خود را بر اساس اطلاعات بازیابی‌شده در جستجوهای قبلی به‌روزرسانی کند.

  • موارد استفاده مؤثر: برای پرسش‌های پیچیده‌ای مناسب‌تر است که به چند جستجوی هدفمند در مستندات گسترده نیاز دارند.

نمونه پرس‌وجوها:

  • «سیاست‌های منابع انسانی برای بازنشستگی زودهنگام، مرخصی والدین و انتقال به خارج از کشور چیست؟»

  • «توضیح دهید تابع process_order چه کاری انجام می‌دهد، همه روش‌هایی را که این تابع فراخوانی می‌کند فهرست کنید و هر روش فراخوانی‌شده را به‌اختصار شرح دهید.»

با وجود نقاط قوتشان، مدل‌های سری o ممکن است وقتی یک پرس‌وجو به بیش از سه جستجو نیاز دارد دچار مشکل شوند.

نکاتی برای بهبود نتایج جستجوی فایل

  • برای پرسش‌های پیچیده‌ای که به چند جستجو نیاز دارند، استفاده از یک مدل سری o را امتحان کنید.

  • به یاد داشته باشید پاسخ‌ها ممکن است بسته به نوع، تعداد و اندازه اسنادی که بارگذاری می‌کنید متفاوت باشند.

  • به‌طور کلی، بارگذاری تعداد کمتری سند متمرکز به دقت بالاتر منجر می‌شود.

  • موضوعات چندپرسشی را به پرسش‌های تکی تبدیل کنید:

    • اگر لازم است سیاست‌های منابع انسانی هر ایالت را بدانید، آن‌ها را یکی‌یکی بپرسید.

    • اگر لازم است اسناد زیادی را خلاصه کنید، هر بار برای یک سند درخواست بدهید. اگر آن سند چند صد صفحه است، در نظر بگیرید آن را به اجزای کوچک‌تر تقسیم کنید.

      • اگر به‌جای اسناد کامل، چند خلاصه به ChatGPT Enterprise داده باشید، می‌توانید از آن بخواهید یک «خلاصه‌ای از خلاصه‌ها» بنویسد.

    • اگر یک CSV از یک RFP دارید (هر خط یک پرسش متفاوت است)، به‌جای اینکه فقط CSV را بارگذاری کنید و یک پاسخ واحد بخواهید، آن پرسش‌ها را یکی‌یکی بپرسید.

  • راه‌هایی برای ممیزی پاسخ‌های مدل پیدا کنید. نمونه دستورالعمل‌های GPT در ادامه آمده است:

# زمینه 

شما در فهم اسناد خبره هستید. کاربر قرار است یک سند پیوست کند و یک سؤال بپرسد. او باید بتواند پاسخ شما را به بخش دقیق متن که پاسخ را از آن برداشته‌اید ربط دهد.

# دستورالعمل‌ها

1. بر اساس سند پیوست‌شده کاربر و با استفاده از قالب دقیق زیر به سؤال او پاسخ دهید

# قالب

- سؤال: { سؤال کاربر را تکرار کنید }
- پاسخ: { به سؤال کاربر پاسخ دهید }
منبع:
- - شماره بخش: { شماره بخشی را که پاسخ را از آن گرفته‌اید ارائه کنید }
- - عنوان بخش: { عنوان بخشی را که پاسخ را از آن گرفته‌اید ارائه کنید }
- - متن دقیق: { متن دقیقی را که پاسخ را از آن گرفته‌اید ارائه کنید }

# قوانین

- پاسخ‌ها را روشن و مختصر ارائه کنید
- فقط اطلاعاتی را ارائه کنید که در سند آمده است
- اگر نمی‌توانید پاسخ را در سند پیدا کنید، فقط این‌گونه پاسخ دهید: «هیچ اطلاعاتی یافت نشد.»

آیا این مقاله مفید بود؟