OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

டோக்கன்களைப் புரிந்துகொண்டு எண்ணுதல்

உள்ளீடு, வெளியீடு, தற்காலிகச் சேமிப்பிலுள்ள மற்றும் ரீஸனிங் டோக்கன்கள் API பயன்பாடு, மாடல் வரம்புகள், செலவுகளை எவ்வாறு பாதிக்கின்றன என்பதை அறிக.

புதுப்பிக்கப்பட்டது: 15 days ago

மேலோட்டம்

உரையைச் செயலாக்க OpenAI மாடல்கள் பயன்படுத்தும் அலகுகளே டோக்கன்கள். ஒரு டோக்கன் ஓர் எழுத்துரு, சொல்லின் ஒரு பகுதி, முழுச் சொல் அல்லது நிறுத்தக்குறியைக் குறிக்கலாம். உரை டோக்கன்களாகப் பிரிக்கப்படும் விதத்தை இடைவெளிகளும் பாதிக்கின்றன.

டோக்கன் எண்ணிக்கையும் சொல் எண்ணிக்கையும் ஒன்றல்ல. மாடல், அதன் குறியாக்கம் மற்றும் மொழியைப் பொறுத்து ஒரே உரை வெவ்வேறு டோக்கன் எண்ணிக்கைகளை உருவாக்கலாம்.

உரை எவ்வாறு டோக்கன்களாக மாறுகிறது என்பதைப் புரிந்துகொள்ளவும்

ஒரு மாடலுக்கு உரையை அனுப்பும்போது:

  1. உரை டோக்கன்களாகப் பிரிக்கப்படுகிறது.

  2. மாடல் அந்த டோக்கன்களைச் செயலாக்குகிறது.

  3. மாடல் வெளியீட்டு டோக்கன்களை உருவாக்குகிறது. நீங்கள் பெறும் உரையும், ரீஸனிங் மாடல்களில் பதில் உரையாகக் காட்டப்படாத அக ரீஸனிங் டோக்கன்களும் இவற்றில் அடங்கலாம்.

ஆங்கில உரைக்கு உத்தேச மதிப்பீடுகளைப் பயன்படுத்தவும்

ஆங்கில உரையின் அளவை மதிப்பிட இந்த உத்தேச மதிப்பீடுகள் உதவும்:

  • 1 டோக்கன் என்பது தோராயமாக 4 எழுத்துருக்கள்.

  • 1 டோக்கன் என்பது தோராயமாக ஒரு சொல்லின் முக்கால் பகுதி.

  • 100 டோக்கன்கள் என்பது தோராயமாக 75 சொற்கள்.

இவை உத்தேச மதிப்பீடுகள் மட்டுமே, துல்லியமான எண்ணிக்கைகள் அல்ல. வாக்கியம் மற்றும் பத்தியின் நீளங்கள் மாறுபடும்; பிற மொழிகளில் எழுத்துருக்கள், சொற்கள், டோக்கன்கள் ஆகியவற்றுக்கு இடையிலான தொடர்புகளும் வேறுபடலாம்.

இடைவெளிகளையும் பேரெழுத்தாக்கத்தையும் கணக்கில் கொள்ளவும்

எழுத்துக்கூட்டல், பேரெழுத்தாக்கம் மற்றும் சுற்றியுள்ள உரையைப் பொறுத்து ஒரு சொல் வெவ்வேறு டோக்கன்களாகப் பிரிக்கப்படலாம்.

எடுத்துக்காட்டாக, red, Red மற்றும் red ஆகியவை ஒரே உரையைக் கொண்டிருக்கவில்லை: கடைசி எடுத்துக்காட்டின் தொடக்கத்தில் ஓர் இடைவெளி உள்ளது. ஒரு குறியாக்கம் அவற்றை வெவ்வேறு விதமாகக் குறிக்கலாம்.

டோக்கன் அடையாள எண்களும் குறியாக்கத்தைப் பொறுத்து அமையும். எடுத்துக்காட்டிலுள்ள ஒரு டோக்கன் அடையாள எண் எல்லா மாடல்களுக்கும் பொருந்தும் என்று கருத வேண்டாம்.

உள்ளீட்டு மற்றும் வெளியீட்டு டோக்கன்களை வேறுபடுத்திப் பார்க்கவும்

வகைஇது விவரிப்பது
உள்ளீட்டு டோக்கன்கள்ஒரு கோரிக்கையில் மாடலுக்கு வழங்கப்படும் டோக்கன்கள். இவை ப்ராம்ப்ட் டோக்கன்கள் என்றும் அழைக்கப்படுகின்றன.
வெளியீட்டு டோக்கன்கள்மாடல் உருவாக்கும் டோக்கன்கள். Chat Completions இவற்றை நிறைவு டோக்கன்கள் என அழைக்கிறது.
தற்காலிகச் சேமிப்பிலுள்ள உள்ளீட்டு டோக்கன்கள்ப்ராம்ப்ட் தற்காலிகச் சேமிப்பு மூலம் மீண்டும் பயன்படுத்தப்படும் உள்ளீட்டு டோக்கன்கள். தற்காலிகச் சேமிப்பில் இல்லாத உள்ளீட்டு டோக்கன்களுக்கான விலையிலிருந்து இவற்றின் விலை மாறுபடலாம்.
ரீஸனிங் டோக்கன்கள்கண்ணுக்குத் தெரியும் பதிலை உருவாக்குவதற்கு முன், ரீஸனிங் மாடல் அகத்தில் பயன்படுத்தும் டோக்கன்கள்.

ரீஸனிங் டோக்கன்கள் பதில் உரையாகத் தெரியாது. ஆனால் அவை வெளியீட்டுப் பயன்பாட்டில் கணக்கிடப்பட்டு, வெளியீட்டு டோக்கன்களாகக் கட்டணம் விதிக்கப்படும்.

எனவே, கண்ணுக்குத் தெரியும் ஒரு குறுகிய பதில், காட்டப்படும் உரை உணர்த்துவதைவிட அதிக டோக்கன்களைப் பயன்படுத்தலாம்.

கோரிக்கையை அனுப்புவதற்கு முன் டோக்கன்களை எண்ணவும்

எளிய உரையை எண்ணவும்

உரை எவ்வாறு டோக்கன்களாகப் பிரிக்கப்படுகிறது என்பதைப் பார்க்க டோக்கனைசரைப் பயன்படுத்தவும்.

நிரல் வழியாக எளிய உரையை டோக்கனைஸ் செய்ய, tiktokenஐப் பயன்படுத்தவும். tiktoken.encoding_for_model(model) போன்ற முறையைப் பயன்படுத்தி, உங்கள் இலக்கு மாடலுக்கான குறியாக்கத்தைத் தேர்ந்தெடுக்கவும்.

எளிய உரையின் டோக்கன் எண்ணிக்கையில், API கோரிக்கையிலுள்ள எல்லா டோக்கன்களும் அவசியம் சேர்க்கப்படாது. செய்திக் கட்டமைப்பு, கருவிகள், திட்டவடிவங்கள், படங்கள் மற்றும் கோப்புகள் முழு உள்ளீட்டு எண்ணிக்கையைப் பாதிக்கலாம்.

முழுமையான Responses உள்ளீட்டை எண்ணவும்

முழுமையான Responses API உள்ளீட்டுக்கு, உள்ளீட்டு டோக்கன் எண்ணும் APIஐப் பயன்படுத்தவும்.

செய்திகள், படங்கள், கோப்புகள், கருவிகள் மற்றும் உரையாடல்கள் உள்ளிட்ட Responses உள்ளீட்டு வடிவங்களை அது ஏற்கிறது. செய்திப் பாத்திரங்கள் மற்றும் எல்லைகள் போன்ற கோரிக்கைக் கட்டமைப்புக்குப் பயன்படுத்தப்படும் வடிவமைப்பு டோக்கன்களும் அதன் எண்ணிக்கையில் அடங்கும்.

மாடல் எத்தனை வெளியீட்டு டோக்கன்களை உருவாக்கும் என்பதை உள்ளீட்டு எண்ணிக்கை முன்கணிக்காது.

உண்மையான டோக்கன் பயன்பாட்டைச் சரிபார்க்கவும்

கோரிக்கைக்குப் பிறகு, அதன் பயன்பாட்டுத் தகவலைப் பார்வையிடவும். எண்ட்பாயிண்டைப் பொறுத்து புலப் பெயர்கள் மாறுபடும்:

  • Chat Completions ஆனது prompt_tokens, completion_tokens மற்றும் total_tokens ஆகியவற்றைத் தெரிவிக்கிறது.

  • Responses ஆனது input_tokens, output_tokens மற்றும் total_tokens ஆகியவற்றைத் தெரிவிக்கிறது.

காலப்போக்கிலான செயல்பாட்டைப் பயன்பாட்டு முகப்புப் பலகையிலும் நீங்கள் மதிப்பாய்வு செய்யலாம். தொடர்ச்சியாகத் தரவனுப்பும் பயன்பாடு உள்ளிட்ட வழிமுறைகளுக்கு, இதைப் பார்க்கவும்: API பயன்பாட்டையும் செலவுகளையும் மதிப்பாய்வு செய்தல்.

மாடல் வரம்புகளுக்குள் இருக்கவும்

உங்கள் மாடலின் சூழல் சாளரம் மற்றும் அதிகபட்ச வெளியீடு குறித்த விவரங்களுக்கு அதன் ஆவணத்தைப் பார்க்கவும். இந்த வரம்புகள் மாடல்களுக்கு இடையே மாறுபடலாம்.

ஒரு கோரிக்கையில் மாடல் கையாளக்கூடிய டோக்கன்களைச் சூழல் சாளரம் வரம்பிடுகிறது. மாடல்களுக்கு வெளியீட்டு வரம்பும் உண்டு. ரீஸனிங் மாடல்களில், கண்ணுக்குத் தெரியும் பதிலுடன் ரீஸனிங் டோக்கன்களுக்கும் இடம் ஒதுக்கவும்.

உங்கள் உள்ளீடு மிகப் பெரிதாக இருந்தால், நீங்கள் செய்யக்கூடியவை:

  • ப்ராம்ப்ட்டைச் சுருக்கவும் அல்லது வேறு விதமாக எழுதவும்.

  • தேவையற்ற அல்லது மீண்டும் வரும் சூழலை அகற்றவும்.

  • பெரிய உள்ளீடுகளைச் சிறிய பகுதிகளாகப் பிரிக்கவும்.

  • உரையை அனுப்புவதற்கு முன் சுருக்கவும் அல்லது முன்செயலாக்கவும்.

உங்கள் எண்ட்பாயிண்டும் மாடலும் ஆதரிக்கும் வெளியீட்டு டோக்கன் அமைப்பைப் பயன்படுத்தவும். Chat Completions ஆனது max_completion_tokensஐப் பயன்படுத்துகிறது; Responses ஆனது max_output_tokensஐப் பயன்படுத்துகிறது.

இந்தக் கோரிக்கை அளவு வரம்புகள், API விகித வரம்புகள் மற்றும் மாதாந்திரப் பயன்பாட்டு அல்லது செலவு வரம்புகளிலிருந்து தனியானவை. நீங்கள் பயன்படுத்தும் மாடலுக்கான மாடல் ஆவணத்தை மதிப்பாய்வு செய்யவும்.

டோக்கன் விலை நிர்ணயத்தைப் புரிந்துகொள்ளவும்

டோக்கன் அடிப்படையிலான API விலை நிர்ணயத்தில், கட்டணம் மாடலையும் டோக்கன் வகையையும் பொறுத்தது. உள்ளீடு, தற்காலிகச் சேமிப்பிலுள்ள உள்ளீடு மற்றும் வெளியீட்டு டோக்கன்களின் விலைகள் வேறுபடலாம். பிற API திறன்கள் வெவ்வேறு கட்டணக் கணக்கீட்டு அலகுகளைப் பயன்படுத்தலாம்.

தற்போதைய கட்டணங்களுக்கு API விலை நிர்ணயப் பக்கத்தைப் பார்க்கவும்.

மாடல்களை ஒப்பிடும்போது, உங்கள் பணியை முடிக்கத் தேவையான மொத்த டோக்கன்களையும் செலவையும் கருத்தில் கொள்ளவும். பத்து இலட்சம் டோக்கன்களுக்கான விலை குறைவாக இருப்பதால் மொத்தச் செலவும் குறைவாக இருக்கும் என்பது உறுதியல்ல: ஒரே உரையை மாடல்கள் வெவ்வேறு விதமாக டோக்கனைஸ் செய்து, வெவ்வேறு அளவு வெளியீடு அல்லது ரீஸனிங்கை உருவாக்கலாம்.

கண்ணுக்குத் தெரியும் பதிலின் நீளத்தை மட்டும் ஒப்பிடாமல், பிரதிநிதித்துவப் பணிகளைச் சோதிக்கவும்.

பல நிறைவுகளை கணக்கில் கொள்ளவும்

ஓர் எண்ட்பாயிண்டும் மாடலும் பல நிறைவுகளை உருவாக்குவதை ஆதரிக்கும்போது, அந்தக் கூடுதல் நிறைவுகளும் டோக்கன்களைப் பயன்படுத்தும்.

Chat Completionsஇல் nஐ 1க்கு மேல் அமைத்தால் பல தேர்வுகள் உருவாக்கப்படும். அந்தத் தேர்வுகள் அனைத்திலும் உருவாக்கப்பட்ட டோக்கன்களுக்கு உங்களிடம் கட்டணம் வசூலிக்கப்படும்.

பழைய Completions APIஇல், திருப்பி அனுப்பப்படாத வேட்புகளையும் best_of உருவாக்கலாம். எடுத்துக்காட்டாக, best_of = 3 என்பது வேட்புகள் அனைத்திலும் அதிகபட்சமாக 3 × max_tokens நிறைவு டோக்கன்களை உருவாக்கலாம்.

இந்த அளவுருக்கள் எண்ட்பாயிண்டுக்கே உரியவை. n அல்லது best_ofஐ மற்றோர் API அல்லது மாடல் ஆதரிக்கும் என்று கருத வேண்டாம்.

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?