Tokenizer.GetIndexByTokenCount メソッド
定義
重要
一部の情報は、リリース前に大きく変更される可能性があるプレリリースされた製品に関するものです。 Microsoft は、ここに記載されている情報について、明示または黙示を問わず、一切保証しません。
オーバーロード
| 名前 | 説明 |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。 |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。 |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。 |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
パラメーター
- text
- ReadOnlySpan<Char>
エンコードするテキスト。
- maxTokenCount
- Int32
エンコードするトークンの最大数。
- normalizedText
- String
トークナイザーの正規化が有効になっているか、 <paramRef name="considerPreTokenization"></paramRef> が false場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。
- tokenCount
- Int32
トークン数は、最大トークン数よりも小さくする必要がある生成できます。
- considerPreTokenization
- Boolean
トークン化の前に事前トークン化を検討するかどうかを示します。
- considerNormalization
- Boolean
トークン化の前に正規化を検討するかどうかを示します。
返品
トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。
これは、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。
適用対象
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
パラメーター
- text
- String
エンコードするテキスト。
- maxTokenCount
- Int32
エンコードするトークンの最大数。
- normalizedText
- String
トークナイザーの正規化が有効になっているか、 <paramRef name="considerNormalization"></paramRef> が false場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。
- tokenCount
- Int32
トークン数は、最大トークン数よりも小さくする必要がある生成できます。
- considerPreTokenization
- Boolean
トークン化の前に事前トークン化を検討するかどうかを示します。
- considerNormalization
- Boolean
トークン化の前に正規化を検討するかどうかを示します。
返品
トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。
これは、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。
適用対象
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
- ソース:
- Tokenizer.cs
トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
パラメーター
- text
- String
エンコードするテキスト。
- textSpan
- ReadOnlySpan<Char>
textがnullされている場合に使用されるエンコードするテキストのスパン。
- settings
- EncodeSettings
テキストのエンコードに使用する設定。
- fromEnd
- Boolean
テキストの末尾からインデックスを検索するかどうかを指定します。
- normalizedText
- String
トークナイザーの正規化が有効になっているか、 <paramRef name="settings"></paramRef> に ConsiderNormalization が falseされている場合、これは正規化された形式で <paramRef name="text"></paramRef> に設定されます。それ以外の場合、この値は nullに設定されます。
- tokenCount
- Int32
トークン数は、最大トークン数よりも小さくする必要がある生成できます。
返品
トークンの制限を超えずに処理されたテキスト内の最大エンコード容量のインデックス。
<paramRef name="fromEnd"></paramRef> がfalse場合は、含める最後の文字の直後のインデックスを表します。 トークンが適合しない場合、結果は 0 になります。逆に、すべてのトークンが適合する場合、結果は入力テキストの長さ、または正規化が有効になっている場合は normalizedText になります。
<paramRef name="fromEnd"></paramRef> がtrue場合、含める最初の文字のインデックスを表します。 トークンが適合しない場合、結果はテキストの長さになります。逆に、すべてのトークンが適合する場合、結果はゼロになります。
注釈
Tokenizerから派生した型は、この実装をオーバーライドして、より効率的な実装を提供できます。 既定では、 EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)が使用されます。