Sebelum mengirim string untuk dibuat embedding, Anda dapat memperkirakan jumlah token yang akan digunakan dengan memakai pustaka tokenizer tiktoken dari OpenAI.
Hal ini sangat berguna karena model embedding (seperti text-embedding-3-small) memiliki batas maksimum token yang tidak boleh dilampaui.
---
Cara Menghitung Token dengan Tiktoken
Anda dapat menggunakan paket Python tiktoken untuk menghitung jumlah token yang akan dihasilkan sebuah string.
Berikut cuplikan kode contoh:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Penting:
Untuk model embedding generasi ketiga (misalnya, text-embedding-3-small atau text-embedding-3-large), gunakan pengodean "cl100k_base".
Model yang berbeda mungkin memerlukan pengodean yang berbeda—jika ragu, selalu lihat dokumentasi model.
---
Mengapa Penghitungan Token Penting
Jika string Anda melebihi ukuran input maksimum model, permintaan API Anda akan gagal.
Menghitung token secara akurat sebelumnya memastikan alur kerja embedding lebih lancar dan mencegah kesalahan saat pemrosesan.
---
