OpenAI
ਇਸ ਪੰਨੇ ਦਾ ਮਸ਼ੀਨ ਦੁਆਰਾ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਸੀ। ਮੂਲ ਅੰਗਰੇਜ਼ੀ ਲੇਖ ਦੇਖੋ

ਮੈਂ ਸਟਰਿੰਗ ਨੂੰ embed ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਕਿਵੇਂ ਪਤਾ ਲਗਾ ਸਕਦਾ ਹਾਂ ਕਿ ਇਸ ਵਿੱਚ ਕਿੰਨੇ ਟੋਕਨ ਹੋਣਗੇ?

ਇੱਕ embedding ਲਈ ਟੋਕਨ ਦੀ ਗਿਣਤੀ/ਅਨੁਮਾਨ ਲਗਾਉਣਾ

ਅੱਪਡੇਟ ਕੀਤਾ: 18 days ago

ਅੰਕ-ਨਿਰੂਪਣ ਲਈ ਲਿਖਤ-ਲੜੀ ਭੇਜਣ ਤੋਂ ਪਹਿਲਾਂ, OpenAI ਦੇ ਟਿਕਟੋਕਨ ਟੋਕਨ-ਵੰਡ ਸਾਫ਼ਟਵੇਅਰ-ਸੰਗ੍ਰਹਿ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਤੁਸੀਂ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹੋ ਕਿ ਇਸ ਲਈ ਕਿੰਨੇ ਟੋਕਨ ਵਰਤੇ ਜਾਣਗੇ.

ਇਹ ਖ਼ਾਸ ਤੌਰ ’ਤੇ ਲਾਭਦਾਇਕ ਹੈ, ਕਿਉਂਕਿ ਅੰਕ-ਨਿਰੂਪਣ ਮਾਡਲਾਂ (ਜਿਵੇਂ text-embedding-3-small) ਲਈ ਟੋਕਨਾਂ ਦੀ ਵੱਧ ਤੋਂ ਵੱਧ ਹੱਦ ਹੁੰਦੀ ਹੈ, ਜਿਸ ਦੇ ਅੰਦਰ ਰਹਿਣਾ ਜ਼ਰੂਰੀ ਹੈ.

---

Tiktoken ਨਾਲ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਕਿਵੇਂ ਕਰੀਏ

ਤੁਸੀਂ ਕਿਸੇ ਸਟਰਿੰਗ ਦੁਆਰਾ ਬਣਾਏ ਜਾਣ ਵਾਲੇ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਦਾ ਹਿਸਾਬ ਲਗਾਉਣ ਲਈ tiktoken Python ਪੈਕੇਜ ਵਰਤ ਸਕਦੇ ਹੋ.

ਇੱਥੇ ਇੱਕ ਨਮੂਨਾ ਕੋਡ ਸਨਿਪਟ ਹੈ:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

ਮਹੱਤਵਪੂਰਨ:

  • ਤੀਜੀ ਪੀੜ੍ਹੀ ਦੇ ਅੰਕ-ਨਿਰੂਪਣ ਮਾਡਲਾਂ (ਜਿਵੇਂ text-embedding-3-small ਜਾਂ text-embedding-3-large) ਲਈ, ਤੁਹਾਨੂੰ "cl100k_base" ਕੋਡਬੰਦੀ ਵਰਤਣੀ ਚਾਹੀਦੀ ਹੈ.

  • ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਲਈ ਵੱਖਰੀਆਂ ਕੋਡਬੰਦੀਆਂ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ—ਜੇ ਪੱਕਾ ਪਤਾ ਨਾ ਹੋਵੇ, ਤਾਂ ਹਮੇਸ਼ਾ ਮਾਡਲ ਦੇ ਦਸਤਾਵੇਜ਼ ਵੇਖੋ.

---

ਟੋਕਨ ਗਿਣਤੀ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

  • ਜੇ ਤੁਹਾਡੀ ਸਟਰਿੰਗ ਮਾਡਲ ਦੇ ਵੱਧ ਤੋਂ ਵੱਧ ਇਨਪੁੱਟ ਆਕਾਰ ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਤੁਹਾਡੀ API ਬੇਨਤੀ ਅਸਫਲ ਹੋ ਜਾਵੇਗੀ.

  • ਪਹਿਲਾਂ ਹੀ ਟੋਕਨਾਂ ਦੀ ਸਹੀ ਗਿਣਤੀ ਕਰਨ ਨਾਲ ਐਮਬੈਡਿੰਗ ਵਰਕਫਲੋ ਹੋਰ ਸੁਚਾਰੂ ਰਹਿੰਦੇ ਹਨ ਅਤੇ ਪ੍ਰੋਸੈਸਿੰਗ ਦੌਰਾਨ ਗਲਤੀਆਂ ਤੋਂ ਬਚਾਅ ਹੁੰਦਾ ਹੈ.

---

ਕੀ ਇਹ ਲੇਖ ਉਪਯੋਗੀ ਸੀ?