OpenAI
Diese Seite wurde maschinell übersetzt. Den Originalartikel auf Englisch ansehen.

Dateiuploads in ChatGPT Enterprise optimieren

Verstehen Sie, wie ChatGPT Enterprise-Funktionen Dateien je nach Typ, Anzahl und Größe verarbeiten. Verbessern Sie Ausgaben anhand der Dateianforderungen.

Aktualisiert: 16 days ago

ChatGPT Enterprise unterstützt jetzt das Lesen und Verstehen visueller Inhalte (Bilder, Diagramme, Schaubilder usw.), die in PDF-Dateien eingebettet sind, die in Prompts enthalten sind. Nutzer:innen können ein PDF hochladen, und ChatGPT kann den Text und alle visuellen Elemente in dieser Datei interpretieren.

Details finden Sie unter FAQ zu Visual Retrieval mit PDFs.

In ChatGPT Enterprise kannst du Dateien auf verschiedene Arten hochladen:

Dieser Leitfaden erläutert, wie die Funktionen von ChatGPT Enterprise Dateien je nach Typ, Anzahl und Größe verarbeiten. Außerdem beschreibt er Strategien, mit denen du die Ergebnisse entsprechend den Dateianforderungen verbessern kannst.

Zusammenfassung

ChatGPT Enterprise verarbeitet Dateitypen sehr unterschiedlich: Text wird aus Textdokumenten wie PDFs, Präsentationen und Word-Dateien extrahiert, strukturierte Daten aus Tabellenkalkulationen werden mit Python-Code analysiert und Bilddateien werden mit GPT Vision beschrieben. Für das erwartete Ergebnis ist entscheidend, welcher Dateityp welchen Workflow auslöst.

Bei textbasierten Dokumenten fügt ChatGPT Enterprise möglichst viel relevanten Text direkt zusammen mit dem Prompt ein und greift über ein Suchsystem auf weitere Informationen zu. Das eignet sich gut zur Beantwortung konkreter Fragen. Bei komplexen Aufgaben kann diese Vorgehensweise jedoch an Grenzen stoßen, etwa wenn sehr große Dokumente zusammengefasst oder mehrere große Dateien verglichen werden sollen. Im Folgenden erfährst du, mit welchen Strategien du deine Ergebnisse verbessern kannst.

Dateien nach Typ verarbeiten

ChatGPT Enterprise verarbeitet Dateien hauptsächlich auf drei Arten: durch Textextraktion, Codeanalyse und Bildinterpretation. Der Dateityp bestimmt, welchen Workflow ChatGPT Enterprise verwendet.

Textbasierter AbrufCode InterpreterBildverarbeitungVisueller Abruf
Beispiele für Dateitypenpptx, docx, txt, md, json, xml, pdf*
* PDFs, die als

GPT Knowledge
oder

Projektdateien
hochgeladen wurden
csv, xls, xlsx*
*Hinweis: Code Interpreter kann jeden Dateityp verarbeiten. Bei Tabellenkalkulationen verwendet ChatGPT Enterprise jedoch meist standardmäßig CI.
jpg, pngpdf*
* PDFs, die in Prompts enthalten sind
VerhaltenExtrahiert den Text aus der Datei. Ein Teil des Textes wird direkt in das Kontextfenster eingefügt („eingespeist“), ein anderer Teil wird für die Suche gespeichert.Code Interpreter übergibt die Datei zur Verarbeitung an Python.Bilder werden vorbehaltlich der

bekannten Einschränkungen
direkt von multimodalen Modellen interpretiert.
Eine Kombination aus Textabruf und Bildverarbeitung. Text wird digital extrahiert, visuelle Inhalte werden direkt von multimodalen Modellen interpretiert.

Bei reinen Textdateien, Bilddateien oder klar strukturierten Datendateien (z. B. einer Excel-Tabelle mit Transaktionen) stellen diese Kategorien das bestmögliche Verhalten dar.

Es gibt einige weniger eindeutige Grenzfälle, zum Beispiel:

  • Bilder, die in anderen Dateien als PDFs eingebettet sind, werden nicht verarbeitet. Wenn du sie einbeziehen möchtest, konvertiere die Datei vor dem Hochladen in eine PDF-Datei.

  • ChatGPT Enterprise verwendet für Tabellenkalkulationen immer Code Interpreter, selbst wenn das Dokument sehr viel Text enthält. Wenn du ChatGPT Enterprise beispielsweise bittest, eine CSV-Datei mit zehn Textzeilen zu übersetzen, versucht es, die Datei mit einer Python-Bibliothek zu übersetzen. Das ist weniger genau, als wenn das Modell die Übersetzung direkt erstellt. Um dieses Problem zu vermeiden, kannst du die Tabelle in ein textbasiertes Format exportieren, beispielsweise als PDF.

  • Wenn du eine strukturierte Transaktionstabelle in einer JSON-Datei hochlädst, interpretiert ChatGPT Enterprise diese Datei ebenfalls als reinen Text. Wenn du die Daten in einer JSON-Datei analysieren möchtest, weise das Modell in deinem Prompt an, Code Interpreter zu verwenden.

Dateien nach Größe verarbeiten

ChatGPT Enterprise verwendet Modelle mit einem maximalen Kontextfenster von 128k Token (etwa 200 Textseiten). Allerdings werden nicht alle Token verwendet, um den Text aus hochgeladenen Dateien einzubinden. Die Anzahl der „eingefügten“ Token variiert je nach Nutzungsart.

ChatGPT Enterprise „fügt“ eine gewisse Textmenge ein, und der verbleibende Text wird an einen privaten Suchindex gesendet (einen „Vektorspeicher“, eine Art Datenbank, die große Textmengen effizient speichern und abrufen kann). Wenn Sie eine Frage stellen, zieht ChatGPT Enterprise den eingebundenen Text zusammen mit relevanten Abschnitten heran, die aus einem privaten Suchindex abgerufen werden.

Wenn Sie ein einzelnes Dokument hochladen, bindet ChatGPT Enterprise Text vom Anfang an ein, bis das Limit erreicht ist. Wenn Sie mehrere Dokumente hochladen, bindet ChatGPT Enterprise Teile oder die Gesamtheit jedes Dokuments ein. Der gesamte Text aus den Dokumenten wird außerdem an einen privaten Suchindex gesendet.

Kontextbefüllung für Textdokumente

Diese Funktion befindet sich in aktiver Entwicklung. Daher können sich die folgenden Details ohne Vorankündigung ändern.

ChatGPT Enterprise kann bis zu 110k Token aus hochgeladenen Dokumenten im Kontextfenster verarbeiten. Wenn Sie ein oder mehrere Dokumente mit insgesamt weniger als 110k Token hochladen, wird der gesamte Inhalt eingebunden.

Bei einem einzelnen Dokument mit mehr als 110k Token werden nur die ersten 110k Token eingebunden, beginnend am Anfang. Der Rest wird nur an den privaten Suchindex gesendet.

Wenn mehrere Dokumente hochgeladen werden und ihre Gesamtsumme 110k Token überschreitet, nutzt ChatGPT Enterprise einen zweistufigen Prozess, um die Dokumentrepräsentation auszugleichen:

  1. Extrahieren Sie bis zu 55k Token, gleichmäßig auf die hochgeladenen Dokumente verteilt.

  1. Weisen Sie für Dokumente, die im ersten Schritt nicht vollständig repräsentiert wurden, die verbleibenden 55k Token proportional anhand der in jedem Dokument verbleibenden Token zu.

  1. Alle verbleibenden Token werden nur an den privaten Suchindex gesendet.

Sie können die Anzahl der Token in einem Textdokument schätzen, indem Sie den Text des Dokuments in den OpenAI Tokenizer kopieren.

Kontextbefüllung für Multimedia-PDFs

Wenn Nutzer:innen PDFs hochladen, die sowohl Text als auch Bilder enthalten, ermöglicht Visual Retrieval ChatGPT, diese Bilder nativ zusammen mit digital extrahiertem Text zu verarbeiten. Die folgenden Schritte ergänzen unsere Standardverfahren zur Kontextverarbeitung für Multimedia-PDFs:

  • Bildextraktion und Einbettung: Bilder werden extrahiert und zusammen mit dem zugehörigen digitalen Text eingebettet.

  • Intelligente Skalierung: Bilder werden automatisch skaliert, um ein Gleichgewicht zwischen Informationsqualität und effizienter Nutzung des verfügbaren Kontextfensters zu wahren.

Wenn hochgeladene PDFs das Limit von 110k Token überschreiten, werden sowohl Bilder als auch Text in den privaten Suchindex eingebettet. Texteinbettungen verweisen auf relevante Bilder, sodass ChatGPT anhand von Nutzer:innen-Abfragen die passenden Text-Bild-Paare abrufen kann. Abgerufene Bilder werden anschließend mit den nativen multimodalen Fähigkeiten von ChatGPT verarbeitet.

Den Tokenbedarf für Multimedia-PDFs genau zu schätzen, ist schwierig. Tests deuten darauf hin, dass etwa 350 Seiten mit gemischtem Text und Bildern das 110k-Token-Kontextfenster vollständig ausnutzen.

Suchstrategien nach Modelltyp

Sowohl Modelle der GPT-Serie als auch der o-Serie unterstützen Dateiuploads und verwenden identische Logik für Kontextbefüllung und Suchembeddings. Alle Modelle führen hybride Suchen in einem privaten Suchindex aus und kombinieren dabei Keyword- und semantische Methoden. Bei einer hybriden Suche erzeugt das Modell eine Suchphrase auf Grundlage des Prompts der Nutzer:innen, und der private Suchindex ruft entsprechend relevante Texte und Bilder ab.

Diese Modelle unterscheiden sich jedoch darin, wie sie große Dokumente durchsuchen, die das Kontextfenster überschreiten:

Modelle der GPT-Serie

  • Ein Suchvorgang pro Prompt: Modelle der GPT-Serie führen pro Prompt einen Suchvorgang aus.

  • Geeignete Anwendungsfälle: Ideal zur Beantwortung einfacher Fragen, deren Antworten in umfangreicher Dokumentation enthalten sind.

Beispielanfragen:

  • "What is the HR policy for early retirement?"

  • "What does the process_order function do?"

Modelle der o-Serie

  • Mehrere Suchvorgänge pro Prompt: Pro Prompt können mehrere Suchvorgänge (meist zwei bis drei) mit jeweils einer eigenen Suchphrase ausgeführt werden. Die Suchvorgänge werden nacheinander ausgeführt. Das Modell kann seine Vorgehensweise anhand der Ergebnisse vorheriger Suchvorgänge anpassen.

  • Geeignete Anwendungsfälle: Eignet sich besser für komplexe Fragen, die mehrere gezielte Suchvorgänge in umfangreicher Dokumentation erfordern.

Beispielanfragen:

  • "What are the HR policies for early retirement, parental leave, and overseas transfer?"

  • "Explain what the process_order function does, list all methods invoked by this function, and briefly describe each invoked method."

Trotz ihrer Stärken können Modelle der o-Serie Schwierigkeiten mit Anfragen haben, die mehr als drei Suchvorgänge erfordern.

Tipps zur Verbesserung von Dateisuchergebnissen

  • Versuchen Sie, für komplexe Fragen, die mehrere Suchen erfordern, ein Modell der o-Serie zu verwenden.

  • Denken Sie daran, dass Antworten je nach Typ, Anzahl und Größe der hochgeladenen Dokumente variieren können.

  • Im Allgemeinen führt das Laden weniger, fokussierter Dokumente zu höherer Genauigkeit.

  • Wandeln Sie Themen mit mehreren Fragen in Einzelfragen um:

    • Wenn Sie die HR-Richtlinien jedes Bundesstaats kennen müssen, fragen Sie sie einzeln ab.

    • Wenn Sie viele Dokumente zusammenfassen müssen, fragen Sie jeweils nach einem Dokument. Wenn dieses Dokument viele Hundert Seiten umfasst, sollten Sie es in kleinere Bestandteile aufteilen.

      • Sie könnten ChatGPT Enterprise bitten, eine „Zusammenfassung von Zusammenfassungen“ zu erstellen, wenn Sie mehrere Zusammenfassungen statt ganzer Dokumente eingeben.

    • Wenn Sie eine CSV-Datei zu einem RFP haben (jede Zeile ist eine andere Frage), stellen Sie diese Fragen einzeln, statt nur die CSV zu laden und eine einzige Antwort anzufordern.

  • Finden Sie Möglichkeiten, die Antworten des Modells zu überprüfen. Beispielhafte GPT-Anweisungen finden Sie unten:

# Kontext 

Sie sind Expert:in für das Verstehen von Dokumenten. Die Nutzer:innen werden ein Dokument anhängen und eine Frage stellen. Sie müssen Ihre Antwort auf genau die Textstelle zurückführen können, aus der Sie Ihre Antwort entnommen haben.

# Anweisungen

1. Beantworten Sie die Frage der Nutzer:innen anhand des angehängten Dokuments und verwenden Sie dabei genau das unten angegebene Format

# Format

- Frage: { Frage der Nutzer:innen wiederholen }
- Antwort: { eine Antwort auf die Frage der Nutzer:innen geben }
Quelle:
- - Abschnittsnummer: { Abschnittsnummer angeben, aus der Sie die Antwort entnommen haben }
- - Abschnittstitel: { Abschnittstitel angeben, aus dem Sie die Antwort entnommen haben }
- - Exakter Text: { den exakten Text angeben, aus dem Sie die Antwort entnommen haben }

# Regeln

- Geben Sie klare und prägnante Antworten
- Geben Sie nur Informationen an, die im Dokument enthalten sind
- Wenn Sie die Antwort im Dokument nicht finden können, antworten Sie einfach „Keine Informationen gefunden.“

War dieser Artikel hilfreich?