語言

CodeGenTokenizer.GetIndexByTokenCount 方法

定義

多載

名稱 Description
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

參數

text
ReadOnlySpan<Char>

要編碼的文字。

maxTokenCount
Int32

限制編碼容量的最大令牌數。

addPrefixSpace
Boolean

在編碼文字前,請指示是否要加上導引空格。

addBeginningOfSentence
Boolean

指示是否要在編碼中包含句子標記的開頭。

addEndOfSentence
Boolean

指示是否要在編碼中包含句尾的標記。

normalizedText
String

若啟用分詞器的正規化,輸入文字將以正規化形式呈現;否則,該數字將為零。

tokenCount
Int32

代幣數量應該比最大代幣數量還要少。

considerPreTokenization
Boolean

說明是否在分詞化前考慮預先分詞化。

considerNormalization
Boolean

說明是否在分詞前考慮正規化。

傳回

在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。 它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,則結果為文字長度,若啟用正規化則為 。normalizedText

適用於

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

找出最大編碼容量的索引,且不超過令牌限制。

protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

參數

text
String

要編碼的文字。

textSpan
ReadOnlySpan<Char>

如果 為 textnull,則會使用的文字範圍。

settings
EncodeSettings

編碼文字的設定。

fromEnd
Boolean

請指示是否要從文本末尾找到索引。

normalizedText
String

若分詞器的正規化啟用,或 <paramRef 名稱=“settings”></paramRef> 具有 ConsiderNormalization 是 false,則會以正規化形式設定為 <paramRef name=“text”></paramRef> ;否則,此值將設為 null。

tokenCount
Int32

代幣數量應該比最大代幣數量還要少。

傳回

在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。 若 <paramRef 名稱=“fromEnd”></paramRef> 為 false,則代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,結果為輸入文字長度,或啟用正規化則為 。normalizedText 若 <paramRef 名稱=“fromEnd”></paramRef> 為 true,則代表第一個被包含字元的索引。 若無標記可匹配,結果即為文字長度;反之,若所有標記皆符合,結果為零。

適用於

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs
來源:
CodeGenTokenizer.cs

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

參數

text
String

要編碼的文字。

maxTokenCount
Int32

限制編碼容量的最大令牌數。

addPrefixSpace
Boolean

在編碼文字前,請指示是否要加上導引空格。

addBeginningOfSentence
Boolean

指示是否要在編碼中包含句子標記的開頭。

addEndOfSentence
Boolean

指示是否要在編碼中包含句尾的標記。

normalizedText
String

若啟用分詞器的正規化,輸入文字將以正規化形式呈現;否則,該數字將為零。

tokenCount
Int32

代幣數量應該比最大代幣數量還要少。

considerPreTokenization
Boolean

說明是否在分詞化前考慮預先分詞化。

considerNormalization
Boolean

說明是否在分詞前考慮正規化。

傳回

在處理後的文字中,最大編碼容量的索引,且不超過令牌限制。 它代表緊接著最後一個字元後的索引。 若無標記適合,結果為 0;反之,若所有標記皆符合,則結果為文字長度,若啟用正規化則為 。normalizedText

適用於