OpenAI
此頁面由機器翻譯。查看原始英文文章

在 ChatGPT Enterprise 中最佳化檔案上傳

了解 ChatGPT Enterprise 功能如何依檔案類型、數量和大小處理檔案。依檔案需求改善輸出。

更新日期:19 days ago

ChatGPT Enterprise 現在支援讀取並理解提示詞中所含 PDF 檔案內嵌的視覺內容(圖片、圖表、示意圖等)。使用者可以上傳 PDF,而 ChatGPT 能解讀該檔案中的文字以及任何視覺元素。

詳細資訊請參閱PDF 視覺擷取常見問答

ChatGPT Enterprise 提供多種檔案上傳方式:

本指南將說明 ChatGPT Enterprise 的各項功能如何根據檔案類型、數量及大小處理檔案,並探討如何依據檔案需求調整策略,以改善輸出結果。

摘要

ChatGPT Enterprise 處理不同檔案類型的方式差異很大:從 PDF、簡報和 Word 檔案等文字文件擷取文字;使用 Python 程式碼分析試算表中的結構化資料;以及透過 GPT-Vision 描述圖像檔案。若要取得預期結果,關鍵在於瞭解每種檔案類型會觸發哪一種工作流程。

對於文字型文件,ChatGPT Enterprise 會盡可能將相關文字直接放在提示詞旁,並透過搜尋系統存取其他資訊。這種方式很適合回答特定問題。不過,遇到摘要極大型文件或比較多個大型檔案等複雜工作時,這種方式可能難以應付。請繼續閱讀,瞭解改善結果的策略。

依類型處理檔案

ChatGPT Enterprise 主要以三種方式處理檔案:文字擷取、程式碼分析和圖像解讀。ChatGPT Enterprise 採用的工作流程取決於檔案類型

文字型檢索程式碼解譯器圖像處理視覺檢索
檔案類型範例pptx、docx、txt、md、json、xml、pdf*
* 以

GPT 知識


專案檔案
形式上傳的 PDF
csv、xls、xlsx*
*注意:程式碼解譯器可處理任何檔案類型,但 ChatGPT Enterprise 最常預設使用 CI 處理試算表
jpg、pngpdf*
* 使用者提示詞中包含的 PDF
行為從檔案擷取文字:部分文字會直接貼入(「塞入」)上下文視窗,其他文字則儲存以供搜尋程式碼解譯器會將檔案交由 Python 處理圖像會由多模態模型直接解讀,但仍受

已知限制
影響。
結合文字檢索與圖像處理。系統會以數位方式擷取文字,並由多模態模型直接解讀視覺內容。

對於純文字檔案、圖像檔案或結構清楚的資料檔案(例如 Excel 交易資料表),上述分類代表可達到的最佳處理方式。

但也有一些不太明確的灰色地帶,例如:

  • 系統不會處理 PDF 以外其他檔案中嵌入的圖像。若要納入這些圖像,請先將檔案轉換成 PDF 再上傳。

  • ChatGPT Enterprise 一律會使用程式碼解譯器與試算表互動,即使文件包含大量文字也一樣。例如,如果您要求 ChatGPT Enterprise 翻譯含有 10 列文字的 CSV 檔案,它會嘗試使用 Python 程式庫翻譯檔案,其準確度會低於讓模型直接產生翻譯。為減少這類問題,請嘗試將試算表匯出為文字型格式,例如 PDF。

  • 同樣地,如果您上傳 JSON 檔案中的結構化交易資料表,ChatGPT Enterprise 會將此檔案解讀為純文字。如果您想分析 JSON 檔案中的資料,請在提示詞中指示模型使用程式碼解譯器。

依大小處理檔案

ChatGPT Enterprise 使用的模型具備最大 128k Token 的上下文視窗(約 200 頁文字)。不過,並非所有 Token 都會用於納入已上傳檔案中的文字。「填入」的 Token 數量會依使用類型而異。

ChatGPT Enterprise 會「填入」一定量的文字,其餘文字會傳送至私人搜尋索引(一種「向量儲存區」,也就是專為有效儲存和擷取大量文字而設計的資料庫)。當你提出問題時,ChatGPT Enterprise 會帶入已納入的文字,以及從私人搜尋索引擷取的相關片段。

如果你上傳單一文件,ChatGPT Enterprise 會從開頭開始納入文字,直到達到其限制。如果你上傳多個文件,ChatGPT Enterprise 會納入每份文件的部分或全部內容。文件中的所有文字也會傳送至私人搜尋索引。

文字文件的上下文填充

此功能正在積極開發中。因此,以下詳細資訊可能隨時變更,恕不另行通知。

ChatGPT Enterprise 最多可在上下文視窗中處理來自已上傳文件的 110k 個 Token。如果你上傳的一份或多份文件合計少於 110k 個 Token,系統會納入完整內容。

若單一文件超過 110k 個 Token,則只會從開頭開始納入前 110k 個 Token。其餘內容只會傳送至私人搜尋索引。

如果上傳多份文件且合計超過 110k 個 Token,ChatGPT Enterprise 會使用兩步驟流程來平衡各文件的呈現:

  1. 擷取最多 55k 個 Token,並在已上傳文件之間平均分配。

  1. 對於第一步未完整呈現的文件,依各文件剩餘 Token 數按比例分配其餘 55k 個 Token。

  1. 任何剩餘 Token 都只會傳送至私人搜尋索引。

你可以將文件文字複製到 OpenAI Tokenizer,估算文字文件中的 Token 數量。

多媒體 PDF 的上下文填充

當使用者上傳同時包含文字和圖片的 PDF 時,視覺擷取可讓 ChatGPT 在處理數位擷取文字的同時,原生處理這些圖片。下列步驟是我們針對多媒體 PDF 標準上下文處理程序的補充:

  • 圖片擷取與嵌入:圖片會與其相關數位文字一併擷取並嵌入。

  • 智慧縮放:圖片會自動縮放,以在資訊品質與可用上下文視窗的高效使用之間維持平衡。

當已上傳的 PDF 超過 110k 個 Token 限制時,圖片和文字都會嵌入私人搜尋索引。文字嵌入會參照相關圖片,讓 ChatGPT 能根據使用者查詢擷取適當的文字與圖片配對。接著,擷取到的圖片會使用 ChatGPT 的原生多模態能力進行處理。

準確估算多媒體 PDF 的 Token 需求並不容易。測試顯示,約 350 頁混合文字與圖片的內容會完全用滿 110k 個 Token 的上下文視窗。

依模型類型而定的搜尋策略

GPT 系列和 o 系列模型皆支援檔案上傳,並使用相同的上下文填充和搜尋嵌入邏輯。所有模型都會針對私人搜尋索引執行混合搜尋,結合關鍵字和語意方法。在混合搜尋中,模型會根據使用者的提示詞產生搜尋詞句,而私人搜尋索引會據此擷取相關文字和圖片。

不過,這些模型在搜尋超出上下文視窗的大型文件時,做法有所不同:

GPT 系列模型

  • 每個提示詞僅搜尋一次:GPT 系列模型會針對每個使用者提示詞執行一次搜尋。

  • 適用情境:最適合回答大量文件中可直接找到答案的明確問題。

查詢範例:

  • 「提前退休有哪些人資政策?」

  • process_order 函式有什麼作用?」

o 系列模型

  • 每個提示詞可執行多次搜尋:每個使用者提示詞可執行多次搜尋(通常為 2 至 3 次),每次使用不同的搜尋詞組。搜尋會依序執行,模型可根據先前搜尋取得的資訊調整做法。

  • 適用情境:較適合需要在大量文件中進行多次精準搜尋的複雜問題。

查詢範例:

  • 「提前退休、育嬰假和海外調職有哪些人資政策?」

  • 「說明 process_order 函式的作用,列出此函式叫用的所有方法,並簡要說明每個方法。」

儘管 o 系列模型有這些優勢,但遇到需要搜尋三次以上的查詢時,仍可能難以處理。

改善檔案搜尋結果的提示

  • 對於需要多次搜尋的複雜問題,請嘗試使用 o 系列模型。

  • 請記住,回覆可能會依你上傳文件的類型、數量和大小而有所不同。

  • 一般來說,載入較少且重點明確的文件會帶來更高的準確度。

  • 將多問題主題轉換為單一問題:

    • 如果你需要了解每個州的人資政策,請逐一提問。

    • 如果你需要摘要多份文件,請一次要求摘要一份文件。如果該文件有數百頁,請考慮將其拆分成較小的部分。

      • 如果你提供多份摘要而非整份文件,可以要求 ChatGPT Enterprise 撰寫「摘要的摘要」。

    • 如果你有一個 RFP 的 CSV(每一行都是不同問題),請逐一提問,而不是只載入 CSV 並要求單一回覆。

  • 找出稽核模型回覆的方法。GPT 指示範例如下:

# 背景 

你是理解文件的專家。使用者將會附上一份文件並提出問題。他們需要能夠將你的答案連回你取得答案時所依據的確切文字位置。

# 指示

1. 根據使用者附上的文件回答問題,並使用下方提供的確切格式

# 格式

- 問題:{ repeat user's question }
- 答案:{ provide an answer to user's question }
來源:
- - 章節編號:{ provide section number where you pulled in the answer }
- - 章節標題:{ provide section title where you pulled in the answer }
- - 確切文字:{ provide the exact text where you pulled the answer from }

# 規則

- 回答應清楚且簡潔
- 只提供文件中提供的資訊
- 如果你無法在文件中找到答案,請直接回覆「找不到資訊。」

這篇文章有幫助嗎?