CodeGenTokenizer.GetIndexByTokenCount 方法
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
多載
| 名稱 | Description |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。 |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
找出最大編碼容量的索引,且不超過令牌限制。 |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。 |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- ReadOnlySpan<Char>
要編碼的文字。
- maxTokenCount
- Int32
限制編碼容量的最大令牌數。
- addPrefixSpace
- Boolean
在編碼文字前,請指示是否要加上導引空格。
- addBeginningOfSentence
- Boolean
指示是否要在編碼中包含句子標記的開頭。
- addEndOfSentence
- Boolean
指示是否要在編碼中包含句尾的標記。
- normalizedText
- String
若啟用分詞器的正規化,輸入文字將以正規化形式呈現;否則,該數字將為零。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,則結果為文字長度,若啟用正規化則為 。normalizedText
適用於
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
找出最大編碼容量的索引,且不超過令牌限制。
protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
參數
- text
- String
要編碼的文字。
- textSpan
- ReadOnlySpan<Char>
如果 為 textnull,則會使用的文字範圍。
- settings
- EncodeSettings
編碼文字的設定。
- fromEnd
- Boolean
請指示是否要從文本末尾找到索引。
- normalizedText
- String
若分詞器的正規化啟用,或 <paramRef 名稱=“settings”></paramRef> 具有 ConsiderNormalization 是 false,則會以正規化形式設定為 <paramRef name=“text”></paramRef> ;否則,此值將設為 null。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
若 <paramRef 名稱=“fromEnd”></paramRef> 為 false,則代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,結果為輸入文字長度,或啟用正規化則為 。normalizedText
若 <paramRef 名稱=“fromEnd”></paramRef> 為 true,則代表第一個被包含字元的索引。 若無標記可匹配,結果即為文字長度;反之,若所有標記皆符合,結果為零。
適用於
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。
public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
參數
- text
- String
要編碼的文字。
- maxTokenCount
- Int32
限制編碼容量的最大令牌數。
- addPrefixSpace
- Boolean
在編碼文字前,請指示是否要加上導引空格。
- addBeginningOfSentence
- Boolean
指示是否要在編碼中包含句子標記的開頭。
- addEndOfSentence
- Boolean
指示是否要在編碼中包含句尾的標記。
- normalizedText
- String
若啟用分詞器的正規化,輸入文字將以正規化形式呈現;否則,該數字將為零。
- tokenCount
- Int32
代幣數量應該比最大代幣數量還要少。
- considerPreTokenization
- Boolean
說明是否在分詞化前考慮預先分詞化。
- considerNormalization
- Boolean
說明是否在分詞前考慮正規化。
傳回
在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。
它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,則結果為文字長度,若啟用正規化則為 。normalizedText