Język

Tokenizer.GetIndexByTokenCount Metoda

Definicja

Przeciążenia

Nazwa Opis
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametry

text
ReadOnlySpan<Char>

Tekst do zakodowania.

maxTokenCount
Int32

Maksymalna liczba tokenów do zakodowania.

normalizedText
String

Jeśli normalizacja tokenizatora jest włączona lub <paramRef name="considerPreTokenization"></paramRef> to false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .

tokenCount
Int32

Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu. Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.

Dotyczy

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parametry

text
String

Tekst do zakodowania.

maxTokenCount
Int32

Maksymalna liczba tokenów do zakodowania.

normalizedText
String

Jeśli normalizacja tokenizatora jest włączona lub <paramRef name="considerNormalization"></paramRef> to false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .

tokenCount
Int32

Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu. Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.

Dotyczy

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs
Źródło:
Tokenizer.cs

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parametry

text
String

Tekst do zakodowania.

textSpan
ReadOnlySpan<Char>

Zakres tekstu do zakodowania, który będzie używany, jeśli element text ma wartość null.

settings
EncodeSettings

Ustawienia używane do kodowania tekstu.

fromEnd
Boolean

Określ, czy indeks ma znajdować się na końcu tekstu.

normalizedText
String

Jeśli normalizacja tokenizatora jest włączona lub <parametrmRef name="settings"></paramRef> ma ConsiderNormalization wartość false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .

tokenCount
Int32

Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.

Zwraca

Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu. Jeśli <parametrmRef name="fromEnd"></paramRef> to false, reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona. Jeśli <parametrmRef name="fromEnd"></paramRef> to true, reprezentuje indeks pierwszego znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie długością tekstu; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie równy zero.

Uwagi

Typy pochodzące z Tokenizer programu mogą zastąpić tę implementację w celu zapewnienia bardziej wydajnej implementacji. Domyślnie używa elementu EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).

Dotyczy