Tokenizer.GetIndexByTokenCount メソッド

定義

オーバーロード

名前 説明
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

ソース:
Tokenizer.cs
ソース:
Tokenizer.cs
ソース:
Tokenizer.cs

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

パラメーター

text
ReadOnlySpan<Char>

エンコードするテキスト。

maxTokenCount
Int32

エンコードするトークンの最大数。

normalizedText
String

トークナイザーの正規化が有効になっているか、 <paramRef name="considerPreTokenization"></paramRef> が false場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。

tokenCount
Int32

トークン数は、最大トークン数よりも小さくする必要がある生成できます。

considerPreTokenization
Boolean

トークン化の前に事前トークン化を検討するかどうかを示します。

considerNormalization
Boolean

トークン化の前に正規化を検討するかどうかを示します。

返品

トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。 これは、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。

適用対象

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

ソース:
Tokenizer.cs
ソース:
Tokenizer.cs
ソース:
Tokenizer.cs

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

パラメーター

text
String

エンコードするテキスト。

maxTokenCount
Int32

エンコードするトークンの最大数。

normalizedText
String

トークナイザーの正規化が有効になっているか、 <paramRef name="considerNormalization"></paramRef> が false場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。

tokenCount
Int32

トークン数は、最大トークン数よりも小さくする必要がある生成できます。

considerPreTokenization
Boolean

トークン化の前に事前トークン化を検討するかどうかを示します。

considerNormalization
Boolean

トークン化の前に正規化を検討するかどうかを示します。

返品

トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。 これは、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。

適用対象

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

ソース:
Tokenizer.cs
ソース:
Tokenizer.cs
ソース:
Tokenizer.cs

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

パラメーター

text
String

エンコードするテキスト。

textSpan
ReadOnlySpan<Char>

textnullされている場合に使用されるエンコードするテキストのスパン。

settings
EncodeSettings

テキストのエンコードに使用する設定。

fromEnd
Boolean

テキストの末尾からインデックスを検索するかどうかを指定します。

normalizedText
String

トークナイザーの正規化が有効になっているか、 <paramRef name="settings"></paramRef> に ConsiderNormalizationfalseされている場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。

tokenCount
Int32

トークン数は、最大トークン数よりも小さくする必要がある生成できます。

返品

トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。 <paramRef name="fromEnd"></paramRef> がfalse場合は、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。 <paramRef name="fromEnd"></paramRef> がtrue場合、含める最初の文字のインデックスを表します。 トークンが適合しない場合、結果はテキストの長さになります。逆に、すべてのトークンが適合する場合、結果はゼロになります。

注釈

Tokenizerから派生した型は、この実装をオーバーライドして、より効率的な実装を提供できます。 既定では、 EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)が使用されます。

適用対象