Abans d'enviar una cadena per a la incrustació, podeu estimar quants segments utilitzarà aplicant la biblioteca de segmentació tiktoken d'OpenAI.
Això és especialment útil perquè els models d'incrustació (com ara text-embedding-3-small) tenen límits màxims de segments que haureu de respectar.
---
Com comptar segments amb Tiktoken
Podeu utilitzar el paquet de Python tiktoken per calcular el nombre de segments que generarà una cadena.
Aquí teniu un fragment de codi d'exemple:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Retorna el nombre de segments d’una cadena de text."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Exemple d’ús
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Important:
Per als models d'incrustació de tercera generació (p. ex.,
text-embedding-3-smallotext-embedding-3-large), heu d'utilitzar la codificació"cl100k_base".Els diferents models poden requerir codificacions diferents; si teniu dubtes, consulteu sempre la documentació del model.
---
Per què és important comptar segments
Si la vostra cadena supera la mida màxima d'entrada del model, la sol·licitud d'API fallarà.
Comptar els segments amb precisió per endavant garanteix fluxos de treball d'incrustació més fluids i evita errors durant el processament.
---
