語言

CodeGenTokenizer.CountTokens 方法

定義

多載

名稱 Description
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

取得輸入文字將被編碼的標記數量。

protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer

參數

text
String

要編碼的文字。

textSpan
ReadOnlySpan<Char>

如果 為 textnull,則會使用的文字範圍。

settings
EncodeSettings

編碼文字的設定。

傳回

輸入文字將被編碼到的標記 ID 數量。

適用於

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

取得輸入文字將被編碼的標記數量。

public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

參數

text
ReadOnlySpan<Char>

要編碼的文字。

addPrefixSpace
Boolean

在編碼文字前,請指示是否要加上導引空格。

addBeginningOfSentence
Boolean

指示是否要在編碼中包含句子標記的開頭。

addEndOfSentence
Boolean

指示是否要在編碼中包含句尾的標記。

considerPreTokenization
Boolean

說明是否在分詞化前考慮預先分詞化。

considerNormalization
Boolean

說明是否在分詞前考慮正規化。

傳回

輸入文字將被編碼的標記數 Ids。

適用於

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

取得輸入文字將被編碼的標記數量。

public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

參數

text
String

要編碼的文字。

addPrefixSpace
Boolean

在編碼文字前,請指示是否要加上導引空格。

addBeginningOfSentence
Boolean

指示是否要在編碼中包含句子標記的開頭。

addEndOfSentence
Boolean

指示是否要在編碼中包含句尾的標記。

considerPreTokenization
Boolean

說明是否在分詞化前考慮預先分詞化。

considerNormalization
Boolean

說明是否在分詞前考慮正規化。

傳回

輸入文字將被編碼的標記數 Ids。

適用於