Abans d'enviar una cadena per generar-ne la incrustació, podeu estimar quants segments utilitzarà mitjançant la biblioteca de tokenització tiktoken d'OpenAI.
Això és especialment útil perquè els models d'incrustació (com ara text-embedding-3-small) tenen límits màxims de segments que haureu de respectar.
---
Com comptar segments amb Tiktoken
Podeu utilitzar el paquet de Python tiktoken per calcular el nombre de segments que generarà una cadena.
Aquí teniu un fragment de codi d'exemple:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Retorna el nombre de segments d’una cadena de text."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Exemple d’ús
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Important:
Per als models d'incrustació de tercera generació (p. ex., text-embedding-3-small o text-embedding-3-large), hauríeu d'utilitzar la codificació "cl100k_base".
Els diversos models poden requerir codificacions diferents; si teniu dubtes, consulteu sempre la documentació del model.
---
Per què és important comptar segments
Si la vostra cadena supera la mida màxima d'entrada del model, la sol·licitud d'API fallarà.
Comptar els segments amb precisió per endavant garanteix fluxos de treball d'incrustació més fluids i evita errors durant el processament.
---
