Què són els segments?
Els segments són els blocs bàsics del text que processen els models d’OpenAI. Poden ser tan curts com un sol caràcter o tan llargs com una paraula sencera, segons l’idioma i el context. Els espais, la puntuació i les paraules parcials contribueixen al recompte de segments. Així és com l’API segmenta internament el teu text abans de generar una resposta.
Regles pràctiques útils per a l’anglès:
1 segment ≈ 4 caràcters
1 segment ≈ ¾ d’una paraula
100 segments ≈ 75 paraules
1–2 frases ≈ 30 segments
1 paràgraf ≈ 100 segments
~1.500 paraules ≈ 2.048 segments
La segmentació varia segons el model i la codificació. Fes servir l’eina Tokenizer o tiktoken.encoding_for_model(model) per obtenir el recompte exacte per al teu model objectiu.
Exemples
Aquests són alguns exemples de textos reals amb els seus recomptes aproximats de segments:
La cita de Wayne Gretzky «Falles el 100 % dels tirs que no fas» = 11 segments
La Carta d’OpenAI = 476 segments
La Declaració d’Independència dels EUA = 1.695 segments
Com es calculen els recomptes de segments
Quan envies text a l’API:
El text es divideix en segments.
El model processa aquests segments.
La resposta es genera com una seqüència de segments i després es torna a convertir en text.
L’ús de segments es controla en diverses categories:
Segments d’entrada – segments de la teva sol·licitud.
Segments de sortida – segments generats a la resposta.
Segments en memòria cau – segments reutilitzats de l’historial de la conversa (sovint facturats a una tarifa reduïda).
Segments de raonament – en alguns models avançats, s’inclouen internament «passos de pensament» addicionals abans de produir la sortida final.
Aquests recomptes apareixen a les metadades de la resposta de l’API i s’utilitzen per a la facturació i el seguiment de l’ús.
Per explorar més la segmentació, pots fer servir la nostra eina interactiva Tokenizer, que et permet calcular el nombre de segments i veure com es divideix el text en segments.
Com a alternativa, si vols segmentar text programàticament, fes servir Tiktoken com a segmentador BPE ràpid utilitzat específicament per als models d’OpenAI.
Límits de segments
Cada model té un límit màxim combinat de segments (entrada + sortida). Els models actuals d’alta capacitat admeten fins a centenars de milers de segments en context, tot i que els límits pràctics poden variar segons la versió del model i el teu nivell d’ús.
Si superes el límit, pots:
Escurçar o reformular les indicacions.
Dividir textos grans en fragments més petits.
Resumir o preprocessar les entrades abans d’enviar-les.
Preus dels segments
L’ús de l’API es cobra per segment i varia segons el model i si els segments són d’entrada, de sortida o en memòria cau. Consulta la pàgina de preus d’OpenAI per veure les tarifes actuals. Alguns models de raonament poden utilitzar més segments internament, però tenen com a objectiu millorar l’eficiència reduint el nombre de segments necessaris per tasca completada.
Explorar els segments
L’API tracta les paraules segons el seu context en les dades del corpus. Els models prenen la indicació, converteixen l’entrada en una llista de segments, processen la indicació i converteixen els segments predits de nou en les paraules que veiem a la resposta.
Allò que ens pot semblar dues paraules idèntiques pot generar-se com a segments diferents segons com estiguin estructurades dins del text. Observa com l’API genera valors de segment per a la paraula «vermell» segons el seu context dins del text:
En el primer exemple anterior, el segment «2266» per a « red» inclou un espai final (nota: són ID de segment d’exemple amb finalitats demostratives).
El segment «2296» per a « Red» (amb un espai inicial i començant amb majúscula) és diferent del segment «2266» per a « red» amb minúscula.
Quan «Red» s’utilitza al començament d’una frase, el segment generat no inclou cap espai inicial. El segment «7738» és diferent dels dos exemples anteriors de la paraula.
Observacions:
Com més probable/freqüent és un segment, més baix és el número de segment que se li assigna:
El segment generat per al punt és el mateix («13») en les 3 frases. Això és perquè, contextualment, el punt s’utilitza de manera força semblant en totes les dades del corpus.
El segment generat per a «red» varia segons la seva posició dins de la frase:
Minúscula al mig d’una frase: « red» - (segment: «2266»)
Majúscula al mig d’una frase: « Red» - (segment: «2297»)
Majúscula al començament d’una frase: «Red» - (segment: «7738»)
