OpenAI
ይህ ገጽ በማሽን የተተረጎመ ነው። ዋናውን የእንግሊዝኛ ጽሑፍ ይመልከቱ

token ምንድናቸው እና እንዴት ይቆጠራሉ?

የተዘመነው፦ 8 days ago

token-ዎች ምንድናቸው?

token-ዎች OpenAI ሞዴሎች የሚያስኬዷቸው የጽሑፍ መሠረታዊ ክፍሎች ናቸው። እንደ ቋንቋውና አውዱ በመመርኮዝ፣ እነሱ እንደ አንድ ቁምፊ አጭር ወይም እንደ ሙሉ ቃል ረጅም ሊሆኑ ይችላሉ። ክፍተቶች፣ ሥርዓተ ነጥቦች እና ከፊል ቃላት ሁሉ ለtoken ብዛት ያበረክታሉ። APIው ምላሽ ከማመንጨቱ በፊት ጽሑፍዎን በውስጥ እንዲህ ይከፋፍላል።

ለእንግሊዝኛ ጠቃሚ የአጠቃላይ መመሪያዎች፦

  • 1 token ≈ 4 ቁምፊዎች

  • 1 token ≈ ¾ ቃል

  • 100 token-ዎች ≈ 75 ቃላት

  • 1–2 ዓረፍተ ነገሮች ≈ 30 token-ዎች

  • 1 አንቀጽ ≈ 100 token-ዎች

  • ~1,500 ቃላት ≈ 2,048 token-ዎች

tokenization እንደ ሞዴልና ኢንኮዲንግ ይለያያል። ለዒላማ ሞዴልዎ ትክክለኛውን ብዛት ለማግኘት የTokenizer መሣሪያን ወይም tiktoken.encoding_for_model(model) ይጠቀሙ።

ምሳሌዎች

ከግምታዊ የtoken ብዛታቸው ጋር አንዳንድ የእውነተኛ ዓለም የጽሑፍ ናሙናዎች እነሆ፦

  • የWayne Gretzky ጥቅስ “You miss 100% of the shots you don’t take” = 11 token-ዎች

  • የOpenAI ቻርተር = 476 token-ዎች

  • የአሜሪካ የነፃነት መግለጫ = 1,695 token-ዎች

የtoken ብዛቶች እንዴት እንደሚሰሉ

ጽሑፍ ወደ API ሲልኩ፦

  1. ጽሑፉ ወደ token-ዎች ይከፈላል።

  2. ሞዴሉ እነዚህን token-ዎች ያስኬዳል።

  3. ምላሹ እንደ token-ዎች ቅደም ተከተል ይመነጫል፣ ከዚያም ወደ ጽሑፍ ተመልሶ ይቀየራል።

የtoken አጠቃቀም በበርካታ ምድቦች ይከታተላል፦

  • የግቤት token-ዎች – በጥያቄዎ ውስጥ ያሉ token-ዎች።

  • የውጤት token-ዎች – በምላሹ ውስጥ የተመነጩ token-ዎች።

  • የተሸጎጡ token-ዎች – በውይይት ታሪክ ውስጥ እንደገና የተጠቀሙ token-ዎች (ብዙውን ጊዜ በተቀነሰ ዋጋ የሚከፈሉ)።

  • የማመዛዘን token-ዎች – በአንዳንድ የላቁ ሞዴሎች ውስጥ፣ የመጨረሻውን ውጤት ከማምረት በፊት ተጨማሪ “የማሰብ ደረጃዎች” በውስጥ ይካተታሉ።

እነዚህ ብዛቶች በAPI ምላሽዎ ሜታዳታ ውስጥ ይታያሉ፣ እና ለክፍያ እና ለአጠቃቀም ክትትል ያገለግላሉ።

tokenizationን በተጨማሪ ለመመርመር፣ የtoken-ዎችን ብዛት እንዲያሰሉ እና ጽሑፍ ወደ token-ዎች እንዴት እንደሚከፈል እንዲያዩ የሚያስችለውን በይነተገናኝ Tokenizer መሣሪያችንን መጠቀም ይችላሉ።

በአማራጭ፣ ጽሑፍን በፕሮግራም tokenize ማድረግ ከፈለጉ፣ በተለይ ለOpenAI ሞዴሎች የሚጠቀሙበትን ፈጣን BPE tokenizer የሆነውን Tiktoken ይጠቀሙ።

የtoken ገደቦች

እያንዳንዱ ሞዴል ከፍተኛ የተዋሃደ የtoken ገደብ (ግቤት + ውጤት) አለው። የአሁኑ ከፍተኛ አቅም ያላቸው ሞዴሎች በአውድ ውስጥ እስከ መቶ ሺዎች የሚደርሱ token-ዎችን ይደግፋሉ፣ ሆኖም ተግባራዊ ገደቦች እንደ ሞዴሉ ስሪት እና እንደ አጠቃቀም ደረጃዎ ሊለያዩ ይችላሉ።

ገደቡን ካለፉ፣ ይህን ማድረግ ይችላሉ፦

  • እርምጃዎችን ያሳጥሩ ወይም በሌላ አነጋገር ይጻፉ።

  • ትልቅ ጽሑፍን ወደ ትናንሽ ክፍሎች ይከፋፍሉ።

  • ግቤቶችን ከመላክዎ በፊት ያጠቃልሉ ወይም ቀድመው ያስኬዱ።

የtoken ዋጋ

የAPI አጠቃቀም በtoken ይከፈላል፣ ዋጋውም እንደ ሞዴል እና token-ዎቹ ግቤት፣ ውጤት ወይም የተሸጎጡ መሆናቸው ይለያያል። የአሁኑን ተመኖች ለማየት የOpenAIን የዋጋ ገጽ ይመልከቱ። አንዳንድ የማመዛዘን ሞዴሎች በውስጥ ተጨማሪ token-ዎችን ሊጠቀሙ ይችላሉ፣ ግን ለእያንዳንዱ የተጠናቀቀ ተግባር የሚያስፈልጉ token-ዎችን በመቀነስ ብቃትን ለማሻሻል ይ aiming ያደርጋሉ።

token-ዎችን መመርመር

APIው ቃላትን በኮርፐስ ውሂብ ውስጥ እንዳላቸው አውድ መሠረት ይይዛቸዋል። ሞዴሎች እርምጃውን ይወስዳሉ፣ ግቤቱን ወደ token-ዎች ዝርዝር ይቀይራሉ፣ እርምጃውን ያስኬዳሉ፣ እና የተተነበዩትን token-ዎች በምላሹ ውስጥ ወደምናያቸው ቃላት መልሰው ይቀይራሉ።

ለእኛ ሁለት ተመሳሳይ ቃላት የሚመስሉት፣ በጽሑፉ ውስጥ እንዴት እንደተዋቀሩ በመመርኮዝ ወደ ተለያዩ token-ዎች ሊመነጩ ይችላሉ። APIው በጽሑፉ ውስጥ ባለው አውድ መሠረት ለቃሉ ‘red’ የtoken እሴቶችን እንዴት እንደሚያመነጭ ያስቡ፦

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

ከላይ ባለው የመጀመሪያ ምሳሌ፣ ለ‘ red’ ያለው token “2266” ተከታይ ክፍተት ያካትታል (ማስታወሻ፦ እነዚህ ለማሳያ ዓላማ የተሰጡ የtoken ID ምሳሌዎች ናቸው)።

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

ለ‘ Red’ ያለው token “2296” (መሪ ክፍተት ያለውና በካፒታል ፊደል የሚጀምር)፣ በትንሽ ፊደል ከተጻፈው ‘ red’ የtoken “2266” ይለያል።

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ በዓረፍተ ነገር መጀመሪያ ሲጠቀም፣ የተመነጨው token መሪ ክፍተት አያካትትም። token “7738” ከቀደሙት ሁለት የቃሉ ምሳሌዎች ይለያል።

ምልከታዎች፦

token ይበልጥ ሊሆን/በብዛት ሊጠቀም የሚችል ከሆነ፣ የተመደበለት የtoken ቁጥር ዝቅተኛ ይሆናል፦

  • ለነጥብ የተመነጨው token በሁሉም 3 ዓረፍተ ነገሮች ተመሳሳይ ነው (“13”)። ይህ ምክንያቱ፣ በአውድ አንጻር ነጥቡ በኮርፐስ ውሂብ ሁሉ ውስጥ በተመሳሳይ ሁኔታ ስለሚጠቀም ነው።

  • ለ‘red’ የተመነጨው token በዓረፍተ ነገሩ ውስጥ እንዳለው ቦታ ይለያያል፦

    • በዓረፍተ ነገር መካከል በትንሽ ፊደል፦ ‘ red’ - (token፦ “2266”)

    • በዓረፍተ ነገር መካከል በካፒታል ፊደል፦ ‘ Red’ - (token፦ “2297”)

    • በዓረፍተ ነገር መጀመሪያ በካፒታል ፊደል፦ ‘Red’ - (token፦ “7738”)

ይህ ጽሑፍ ጠቃሚ ነበር?