Tokenizer.GetIndexByTokenCount 方法
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
多載
| 名稱 | Description |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
找出最大編碼容量的索引,且不超過令牌限制。 |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
找出最大編碼容量的索引,且不超過令牌限制。 |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
找出最大編碼容量的索引,且不超過令牌限制。 |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
找出最大編碼容量的索引,且不超過令牌限制。
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- ReadOnlySpan<Char>
要編碼的文字。
- maxTokenCount
- Int32
最多要編碼的標記數量。
- normalizedText
- String
若分詞器的正規化啟用,或 <paramRef 名稱=“considerPreTokenization”></paramRef> 為 false,則會設定為 <paramRef 名稱=“text”></paramRef> 的正規化形式;否則,此值將設為 null。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,結果為輸入文字長度,或啟用正規化則為 。normalizedText
適用於
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
找出最大編碼容量的索引,且不超過令牌限制。
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- String
要編碼的文字。
- maxTokenCount
- Int32
最多要編碼的標記數量。
- normalizedText
- String
若分詞器的正規化已啟用,或 <paramRef 名稱=“considerNormalization”></paramRef> 是 false,則會以正規化形式設定為 <paramRef name=“text”></paramRef> ;否則,此值將設為 null。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,結果為輸入文字長度,或啟用正規化則為 。normalizedText
適用於
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
- 來源:
- Tokenizer.cs
找出最大編碼容量的索引,且不超過令牌限制。
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
參數
- text
- String
要編碼的文字。
- textSpan
- ReadOnlySpan<Char>
如果 為 textnull,則會使用的文字範圍。
- settings
- EncodeSettings
編碼文字的設定。
- fromEnd
- Boolean
請指示是否要從文本末尾找到索引。
- normalizedText
- String
若分詞器的正規化啟用,或 <paramRef 名稱=“settings”></paramRef> 具有 ConsiderNormalization 是 false,則會以正規化形式設定為 <paramRef name=“text”></paramRef> ;否則,此值將設為 null。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
若 <paramRef 名稱=“fromEnd”></paramRef> 為 false,則代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,結果為輸入文字長度,或啟用正規化則為 。normalizedText
若 <paramRef 名稱=“fromEnd”></paramRef> 為 true,則代表第一個被包含字元的索引。 若無標記可匹配,結果即為文字長度;反之,若所有標記皆符合,結果為零。
備註
由 衍生 Tokenizer 出的型別可能會覆寫此實作,以提供更有效率的實作。 預設情況下,它使用 EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)。