CodeGenTokenizer.CountTokens 方法
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
多載
| 名稱 | Description |
|---|---|
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
取得輸入文字將被編碼的標記數量。 |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
取得輸入文字將被編碼的標記數量。 |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
取得輸入文字將被編碼的標記數量。 |
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)
取得輸入文字將被編碼的標記數量。
protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer
參數
- text
- String
要編碼的文字。
- textSpan
- ReadOnlySpan<Char>
如果 為 textnull,則會使用的文字範圍。
- settings
- EncodeSettings
編碼文字的設定。
傳回
輸入文字將被編碼到的標記 ID 數量。
適用於
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)
取得輸入文字將被編碼的標記數量。
public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- ReadOnlySpan<Char>
要編碼的文字。
- addPrefixSpace
- Boolean
在編碼文字前,請指示是否要加上導引空格。
- addBeginningOfSentence
- Boolean
指示是否要在編碼中包含句子標記的開頭。
- addEndOfSentence
- Boolean
指示是否要在編碼中包含句尾的標記。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
輸入文字將被編碼的標記數 Ids。
適用於
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)
取得輸入文字將被編碼的標記數量。
public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- String
要編碼的文字。
- addPrefixSpace
- Boolean
在編碼文字前,請指示是否要加上導引空格。
- addBeginningOfSentence
- Boolean
指示是否要在編碼中包含句子標記的開頭。
- addEndOfSentence
- Boolean
指示是否要在編碼中包含句尾的標記。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
輸入文字將被編碼的標記數 Ids。