Sebelum menghantar rentetan untuk pembenaman, anda boleh menganggarkan bilangan token yang akan digunakan dengan menerapkan pustaka tokenizer tiktoken OpenAI.
Ini amat berguna kerana model pembenaman (seperti text-embedding-3-small) mempunyai had token maksimum yang perlu anda patuhi.
---
Cara Mengira Token dengan Tiktoken
Anda boleh menggunakan pakej Python tiktoken untuk mengira bilangan token yang akan dijana oleh sesuatu rentetan.
Berikut ialah contoh coretan kod:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Penting:
Untuk model pembenaman generasi ketiga (cth.,
text-embedding-3-smallatautext-embedding-3-large), anda harus menggunakan pengekodan"cl100k_base".Model yang berbeza mungkin memerlukan pengekodan yang berbeza — sentiasa rujuk dokumentasi model jika anda tidak pasti.
---
Mengapa Pengiraan Token Penting
Jika rentetan anda melebihi saiz input maksimum model, permintaan API anda akan gagal.
Mengira token dengan tepat lebih awal memastikan aliran kerja pembenaman lebih lancar dan mengelakkan ralat semasa pemprosesan.
---
