OpenAI
Din il-paġna ġiet tradotta awtomatikament bl-IA. Ara l-artiklu oriġinali bl-Ingliż.

Kif nista’ ngħid kemm se jkollha tokens string qabel nipprova nagħmel embedding tagħha?

Kalkolu/approssimazzjoni tat-tokens għal embedding

Aġġornat: 30 days ago

Qabel tibgħat sekwenza ta’ karattri għall-embedding, tista’ tistma kemm se tuża tokens permezz tal-librerija tat-tokenizzatur tiktoken ta’ OpenAI.

Dan huwa partikolarment utli għax il-mudelli tal-embedding (bħal text-embedding-3-small) għandhom limiti massimi ta’ tokens li trid tirrispetta.

---

Kif Tgħodd it-Tokens b’Tiktoken

Tista’ tuża l-pakkett Python tiktoken biex tikkalkula n-numru ta’ tokens li se tiġġenera sekwenza.

Hawn framment ta’ kodiċi bħala eżempju:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Importanti:

  • Għall-mudelli tal-embedding tat-tielet ġenerazzjoni (eż. text-embedding-3-small jew text-embedding-3-large), għandek tuża l-kodifikazzjoni "cl100k_base".

  • Mudelli differenti jistgħu jeħtieġu kodifikazzjonijiet differenti — dejjem irreferi għad-dokumentazzjoni tal-mudell jekk ikollok dubju.

---

Għaliex l-Għadd tat-Tokens Huwa Importanti

  • Jekk is-sekwenza tiegħek taqbeż id-daqs massimu tal-input tal-mudell, it-talba tiegħek lill-API tfalli.

  • L-għadd preċiż tat-tokens minn qabel jiżgura flussi tax-xogħol tal-embeddings aktar bla xkiel u jipprevjeni żbalji waqt l-ipproċessar.

---

Dan l-artiklu kien ta’ għajnuna?