OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Bagaimanakah saya boleh tahu berapa banyak token yang akan ada pada rentetan sebelum saya cuba membenamkannya?

Mengira/menganggarkan token untuk pembenaman

Dikemas kini: 8 days ago

Sebelum menghantar rentetan untuk pembenaman, anda boleh menganggarkan bilangan token yang akan digunakan dengan menerapkan pustaka tokenizer tiktoken OpenAI.

Ini amat berguna kerana model pembenaman (seperti text-embedding-3-small) mempunyai had token maksimum yang perlu anda patuhi.

---

Cara Mengira Token dengan Tiktoken

Anda boleh menggunakan pakej Python tiktoken untuk mengira bilangan token yang akan dijana oleh sesuatu rentetan.

Berikut ialah contoh coretan kod:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Penting:

  • Untuk model pembenaman generasi ketiga (cth., text-embedding-3-small atau text-embedding-3-large), anda harus menggunakan pengekodan "cl100k_base".

  • Model yang berbeza mungkin memerlukan pengekodan yang berbeza — sentiasa rujuk dokumentasi model jika anda tidak pasti.

---

Mengapa Pengiraan Token Penting

  • Jika rentetan anda melebihi saiz input maksimum model, permintaan API anda akan gagal.

  • Mengira token dengan tepat lebih awal memastikan aliran kerja pembenaman lebih lancar dan mengelakkan ralat semasa pemprosesan.

---

Adakah artikel ini membantu?