ChatGPT Enterprise اب پرومپٹس میں شامل PDF فائلوں میں embedded بصری مواد (تصاویر، گراف، ڈایاگرام وغیرہ) کو پڑھنے اور سمجھنے کی حمایت کرتا ہے. صارفین PDF اپ لوڈ کر سکتے ہیں، اور ChatGPT اس فائل کے اندر موجود متن اور کسی بھی بصری عناصر کی تشریح کر سکتا ہے.
تفصیلات کے لیے PDFs کے ساتھ بصری بازیافت کے عمومی سوالات. دیکھیں
ChatGPT Enterprise آپ کو کئی طریقوں سے فائلیں اپ لوڈ کرنے کی سہولت دیتا ہے:
براہِ راست اپنے کمپیوٹر سے
GPT کے علم کے طور پر
پروجیکٹ فائل کے طور پر
GPT کارروائی سے
یہ رہنما بتاتا ہے کہ ChatGPT Enterprise کی خصوصیات فائلوں کی قسم، تعداد اور سائز کے مطابق انہیں کیسے سنبھالتی ہیں، نیز فائل کے تقاضوں کی بنیاد پر نتائج بہتر بنانے کی حکمتِ عملیوں پر گفتگو کرتا ہے.
خلاصہ
ChatGPT Enterprise مختلف اقسام کی فائلوں کو بہت مختلف طریقوں سے سنبھالتا ہے: PDF، پیشکش اور Word جیسی متنی دستاویزات سے متن نکالتا ہے، Python کوڈ کے ذریعے جدولوں کے منظم ڈیٹا کا تجزیہ کرتا ہے اور GPT-Vision کے ذریعے تصویری فائلوں کی وضاحت کرتا ہے. متوقع نتیجہ حاصل کرنے کے لیے یہ سمجھنا ضروری ہے کہ کون سی فائل کس عملی طریقے کو فعال کرتی ہے.
متن پر مبنی دستاویزات کے لیے ChatGPT Enterprise پرومپٹ کے ساتھ براہِ راست زیادہ سے زیادہ متعلقہ متن شامل کرتا ہے اور اضافی معلومات تک رسائی کے لیے تلاش کا نظام استعمال کرتا ہے. یہ مخصوص سوالات کے جواب دینے میں مؤثر ہے. تاہم، بہت بڑی دستاویزات کا خلاصہ بنانے یا متعدد بڑی فائلوں کا موازنہ کرنے جیسے پیچیدہ کاموں میں یہ طریقہ مشکلات کا سامنا کر سکتا ہے. اپنے نتائج بہتر بنانے کی حکمتِ عملیاں سمجھنے کے لیے آگے پڑھیں.
قسم کے مطابق فائلوں کو سنبھالنا
ChatGPT Enterprise فائلوں پر تین بنیادی طریقوں سے کارروائی کرتا ہے: متن نکالنا، کوڈ کا تجزیہ اور تصاویر کی تشریح. فائل کی قسم یہ طے کرتی ہے کہ ChatGPT Enterprise کون سا عملی طریقہ اپنائے گا.
| متن پر مبنی بازیافت | کوڈ انٹرپریٹر | تصویری کارروائی | بصری بازیافت | |
|---|---|---|---|---|
| فائل کی اقسام کی مثالیں | pptx، docx، txt، md، json، xml، pdf* * بطور GPT کا علم یا پروجیکٹ فائلیں اپ لوڈ کردہ PDFs | csv، xls، xlsx* *نوٹ: کوڈ انٹرپریٹر کسی بھی قسم کی فائل پر کام کر سکتا ہے، لیکن ChatGPT Enterprise عموماً جدولوں کے لیے بطور طے شدہ CI استعمال کرتا ہے | jpg، png | pdf* * صارف کے پرومپٹس میں شامل PDFs |
| طرزِ عمل | فائل سے متن نکالتا ہے—کچھ متن براہِ راست سیاق ونڈو میں چسپاں یا ”بھرا“ جاتا ہے، جبکہ کچھ متن تلاش کے لیے محفوظ کیا جاتا ہے. | کوڈ انٹرپریٹر کارروائی کے لیے فائل Python کو بھیجتا ہے. | ملٹی-موڈل ماڈلز تصاویر کی براہِ راست تشریح کرتے ہیں، تاہم ان پر معلوم حدود لاگو ہوتی ہیں. | متن کی بازیافت اور تصویری کارروائی کا امتزاج. متن ڈیجیٹل طریقے سے نکالا جاتا ہے اور ملٹی-موڈل ماڈلز بصری مواد کی براہِ راست تشریح کرتے ہیں. |
صرف متن والی فائلوں، تصویری فائلوں یا واضح طور پر منظم ڈیٹا فائلوں، مثلاً لین دین کی Excel جدول، کے لیے یہ تقسیم بہترین ممکنہ طرزِ عمل کی نمائندگی کرتی ہے.
کچھ صورتیں ایسی بھی ہیں جن کی درجہ بندی اتنی واضح نہیں، مثلاً:
PDF کے علاوہ دوسری فائلوں میں شامل تصاویر پر کارروائی نہیں کی جاتی. انہیں شامل کرنے کے لیے اپ لوڈ کرنے سے پہلے فائل کو PDF میں تبدیل کریں.
ChatGPT Enterprise جدولوں کے ساتھ تعامل کے لیے ہمیشہ کوڈ انٹرپریٹر استعمال کرے گا، خواہ دستاویز میں بہت زیادہ متن موجود ہو. مثلاً اگر آپ ChatGPT Enterprise سے متن کی 10 قطاروں والی CSV فائل کا ترجمہ کرنے کو کہیں، تو وہ Python کتب خانے کے ذریعے فائل کا ترجمہ کرنے کی کوشش کرے گا، جو ماڈل کو براہِ راست ترجمہ بنانے دینے کے مقابلے میں کم درست ہے. اس مسئلے کو کم کرنے کے لیے جدول کو متن پر مبنی شکل، مثلاً PDF، میں برآمد کرنے کی کوشش کریں.
اسی طرح، اگر آپ JSON فائل میں موجود منظم لین دین کی جدول اپ لوڈ کریں تو ChatGPT Enterprise اس فائل کو سادہ متن سمجھے گا. اگر آپ JSON فائل میں موجود ڈیٹا کا تجزیہ کرنا چاہتے ہیں تو اپنے پرومپٹ میں ماڈل کو کوڈ انٹرپریٹر استعمال کرنے کی ہدایت دیں.
سائز کی بنیاد پر فائلوں کو سنبھالنا
ChatGPT Enterprise ایسے ماڈلز استعمال کرتا ہے جن کی زیادہ سے زیادہ سیاق ونڈو 128k ٹوکنز (تقریباً 200 صفحات متن) ہے. تاہم، اپ لوڈ کردہ فائلوں کا متن شامل کرنے کے لیے تمام ٹوکنز استعمال نہیں ہوتے. “stuffed” ٹوکنز کی تعداد استعمال کی قسم کے لحاظ سے بدلتی ہے.
ChatGPT Enterprise کچھ مقدار میں متن "stuffs" کرتا ہے، اور باقی متن نجی تلاش اشاریے (ایک "vector store"، جو بڑی مقدار میں متن کو مؤثر طور پر محفوظ اور بازیافت کرنے کے لیے ڈیزائن کردہ ڈیٹابیس کی ایک قسم ہے) کو بھیجا جاتا ہے. جب آپ سوال پوچھتے ہیں، ChatGPT Enterprise شامل متن کے ساتھ نجی تلاش اشاریے سے بازیافت کردہ متعلقہ حصے بھی لاتا ہے.
اگر آپ ایک ہی دستاویز اپ لوڈ کرتے ہیں، تو ChatGPT Enterprise آغاز سے متن شامل کرتا ہے جب تک کہ وہ اپنی حد تک نہ پہنچ جائے. اگر آپ متعدد دستاویزات اپ لوڈ کرتے ہیں، تو ChatGPT Enterprise ہر دستاویز کا کچھ یا پورا حصہ شامل کرتا ہے. دستاویزات کا تمام متن نجی تلاش اشاریے کو بھی بھیجا جاتا ہے.
متنی دستاویزات کے لیے سیاق stuffing
یہ فیچر فعال ترقی کے مرحلے میں ہے۔ اس لیے، درج ذیل تفصیلات بغیر پیشگی اطلاع کے تبدیل ہو سکتی ہیں۔
ChatGPT Enterprise سیاق ونڈو میں اپ لوڈ کردہ دستاویزات سے 110k ٹوکنز تک پروسیس کر سکتا ہے. اگر آپ ایک یا زیادہ دستاویزات اپ لوڈ کرتے ہیں جن کا مجموعی کل 110k ٹوکنز سے کم ہے، تو پورا مواد شامل کیا جائے گا.
110k ٹوکنز سے زیادہ کی ایک دستاویز کے لیے، آغاز سے صرف پہلے 110k ٹوکنز شامل کیے جائیں گے. باقی حصہ صرف نجی تلاش اشاریے کو بھیجا جائے گا.
اگر متعدد دستاویزات اپ لوڈ کی جائیں اور ان کا مجموعی کل 110k ٹوکنز سے زیادہ ہو، تو ChatGPT Enterprise دستاویزات کی نمائندگی کو متوازن کرنے کے لیے دو مرحلوں کا عمل استعمال کرتا ہے:
55k ٹوکنز تک نکالیں، اپ لوڈ کردہ دستاویزات میں برابر تقسیم کیے ہوئے.
جن دستاویزات کی پہلے مرحلے میں مکمل نمائندگی نہیں ہوئی، ان کے لیے باقی 55k ٹوکنز ہر دستاویز میں بچنے والے ٹوکنز کی بنیاد پر تناسباً مختص کریں.
کوئی بھی باقی ٹوکنز صرف نجی تلاش اشاریے کو بھیجے جاتے ہیں.
آپ کسی متنی دستاویز میں ٹوکنز کی تعداد کا اندازہ دستاویز کے متن کو OpenAI ٹوکنائزر میں کاپی کر کے لگا سکتے ہیں.
ملٹی میڈیا PDFs کے لیے سیاق stuffing
جب صارفین متن اور تصاویر دونوں پر مشتمل PDFs اپ لوڈ کرتے ہیں، تو بصری بازیافت ChatGPT کو ڈیجیٹل طور پر نکالے گئے متن کے ساتھ ان تصاویر کو مقامی طور پر پروسیس کرنے کے قابل بناتی ہے. مندرجہ ذیل مراحل ملٹی میڈیا PDFs کے لیے ہمارے معیاری سیاق-سنبھالنے کے طریقہ کار کو تقویت دیتے ہیں:
تصویر نکالنا اور embedding: تصاویر نکالی جاتی ہیں اور ان کے متعلقہ ڈیجیٹل متن کے ساتھ embedded کی جاتی ہیں.
ذہین پیمانہ بندی: دستیاب سیاق ونڈو کے مؤثر استعمال اور معلوماتی معیار کے درمیان توازن برقرار رکھنے کے لیے تصاویر خودکار طور پر scaled کی جاتی ہیں.
جب اپ لوڈ کردہ PDFs 110k ٹوکن حد سے بڑھ جائیں، تو تصاویر اور متن دونوں نجی تلاش اشاریے میں embedded کیے جاتے ہیں. متنی embeddings متعلقہ تصاویر کا حوالہ دیتے ہیں، جس سے ChatGPT صارف کے سوالات کی بنیاد پر مناسب متن-تصویر جوڑے بازیافت کر سکتا ہے. بازیافت شدہ تصاویر پھر ChatGPT کی مقامی ملٹی-موڈل صلاحیتوں سے پروسیس کی جاتی ہیں.
ملٹی میڈیا PDFs کے لیے ٹوکن ضروریات کا درست اندازہ لگانا مشکل ہے. آزمائش سے ظاہر ہوتا ہے کہ متن اور تصاویر کے ملے جلے تقریباً 350 صفحات 110k ٹوکن سیاق ونڈو کو مکمل طور پر استعمال کر لیں گے.
ماڈل کی قسم کی بنیاد پر تلاش کی حکمت عملیاں
GPT-سیریز اور o-سیریز دونوں ماڈلز فائل اپ لوڈز کی حمایت کرتے ہیں اور یکساں سیاق stuffing اور تلاش embedding منطق استعمال کرتے ہیں. تمام ماڈلز نجی تلاش اشاریے کے خلاف ہائبرڈ تلاشیں انجام دیتے ہیں، جن میں کلیدی الفاظ اور معنوی طریقے شامل ہوتے ہیں. ہائبرڈ تلاش میں، ماڈل صارف کے پرومپٹ کی بنیاد پر تلاش عبارت بناتا ہے، اور نجی تلاش اشاریہ اسی کے مطابق متعلقہ متن اور تصاویر واپس لاتا ہے.
تاہم، یہ ماڈلز سیاق ونڈو سے بڑے بڑے دستاویزات میں تلاش کرنے کے طریقے میں مختلف ہوتے ہیں:
GPT سیریز کے ماڈلز
ہر پرومپٹ کے لیے ایک تلاش: GPT سیریز کے ماڈلز صارف کے ہر پرومپٹ کے لیے ایک تلاش کرتے ہیں.
مؤثر استعمال: وسیع دستاویزات میں موجود سادہ سوالات کے جواب دینے کے لیے بہترین.
مثالی سوالات:
"قبل از وقت سبک دوشی سے متعلق انسانی وسائل کی پالیسی کیا ہے؟"
"process_order فنکشن کیا کرتا ہے؟"
او سیریز کے ماڈلز
ہر پرومپٹ کے لیے متعدد تلاشیں: صارف کے ہر پرومپٹ کے لیے متعدد تلاشیں، عموماً 2-3، انجام دے سکتے ہیں اور ہر تلاش کا فقرہ منفرد ہوتا ہے. تلاشیں یکے بعد دیگرے انجام دی جاتی ہیں اور ماڈل گزشتہ تلاشوں سے حاصل شدہ معلومات کی بنیاد پر اپنا طریقۂ کار تبدیل کر سکتا ہے.
مؤثر استعمال: وسیع دستاویزات میں متعدد مخصوص تلاشیں درکار ہونے والے پیچیدہ سوالات کے لیے زیادہ موزوں.
مثالی سوالات:
"قبل از وقت سبک دوشی، والدین کی رخصت اور بیرونِ ملک تبادلے سے متعلق انسانی وسائل کی پالیسیاں کیا ہیں؟"
"وضاحت کریں کہ process_order فنکشن کیا کرتا ہے، اس فنکشن کے ذریعے طلب کیے جانے والے تمام طریقوں کی فہرست دیں اور ہر طریقے کی مختصر وضاحت کریں."
اپنی خوبیوں کے باوجود، او سیریز کے ماڈلز کو ایسے سوالات میں مشکل پیش آ سکتی ہے جن کے لیے تین سے زیادہ تلاشیں درکار ہوں.
فائل تلاش کے نتائج بہتر بنانے کے مشورے
متعدد تلاشوں کی ضرورت رکھنے والے پیچیدہ سوالات کے لیے o-سیریز ماڈل استعمال کرنے کی کوشش کریں.
یاد رکھیں کہ جوابات آپ کی اپ لوڈ کردہ دستاویزات کی قسم، تعداد، اور سائز کے لحاظ سے بدل سکتے ہیں.
عام طور پر، کم اور مرکوز دستاویزات لوڈ کرنے سے درستگی زیادہ ہوگی.
متعدد سوالات والے موضوعات کو واحد سوالات میں بدلیں:
اگر آپ کو ہر ریاست کی HR پالیسیاں جاننی ہوں، تو انہیں ایک ایک کر کے پوچھیں.
اگر آپ کو بہت سی دستاویزات کا خلاصہ چاہیے، تو ایک وقت میں ایک دستاویز کے بارے میں پوچھیں. اگر وہ دستاویز کئی سو صفحات کی ہے، تو اسے چھوٹے اجزا میں تقسیم کرنے پر غور کریں.
اگر آپ ChatGPT Enterprise کو پوری دستاویزات کے بجائے متعدد خلاصے دیں، تو آپ اس سے “خلاصوں کا خلاصہ” لکھنے کو کہہ سکتے ہیں.
اگر آپ کے پاس کسی RFP کی CSV ہے (ہر سطر ایک مختلف سوال ہے)، تو صرف CSV لوڈ کر کے ایک جواب مانگنے کے بجائے ان سوالات کو ایک ایک کر کے پوچھیں.
ماڈل کے جوابات کا آڈٹ کرنے کے طریقے تلاش کریں. مثالی GPT ہدایات نیچے دی گئی ہیں:
# سیاق
آپ دستاویزات کو سمجھنے کے ماہر ہیں۔ صارف ایک دستاویز منسلک کرے گا اور ایک سوال پوچھے گا۔ انہیں یہ جوڑنے کے قابل ہونا چاہیے کہ آپ نے اپنا جواب متن کے کس درست حصے سے لیا ہے۔
# ہدایات
1. صارف کے سوال کا جواب اس کی منسلک کردہ دستاویز کی بنیاد پر، نیچے دیے گئے عین فارمیٹ میں دیں
# فارمیٹ
- Question: { صارف کے سوال کو دہرائیں }
- Answer: { صارف کے سوال کا جواب دیں }
Source:
- - Section Number: { وہ سیکشن نمبر دیں جہاں سے آپ نے جواب لیا }
- - Section Title: { وہ سیکشن عنوان دیں جہاں سے آپ نے جواب لیا }
- - Exact Text: { وہ عین متن دیں جہاں سے آپ نے جواب لیا }
# قواعد
- جواب واضح اور مختصر دیں
- صرف وہی معلومات دیں جو دستاویز میں موجود ہوں
- اگر آپ کو دستاویز میں جواب نہ ملے، تو بس "کوئی معلومات نہیں ملی۔" جواب دیں