Tokenizer.GetIndexByTokenCount Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Przeciążenia
| Nazwa | Opis |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametry
- text
- ReadOnlySpan<Char>
Tekst do zakodowania.
- maxTokenCount
- Int32
Maksymalna liczba tokenów do zakodowania.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona lub <paramRef name="considerPreTokenization"></paramRef> to false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
- considerPreTokenization
- Boolean
Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.
- considerNormalization
- Boolean
Określ, czy należy rozważyć normalizację przed tokenizacją.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.
Dotyczy
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametry
- text
- String
Tekst do zakodowania.
- maxTokenCount
- Int32
Maksymalna liczba tokenów do zakodowania.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona lub <paramRef name="considerNormalization"></paramRef> to false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
- considerPreTokenization
- Boolean
Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.
- considerNormalization
- Boolean
Określ, czy należy rozważyć normalizację przed tokenizacją.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.
Dotyczy
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
- Źródło:
- Tokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parametry
- text
- String
Tekst do zakodowania.
- textSpan
- ReadOnlySpan<Char>
Zakres tekstu do zakodowania, który będzie używany, jeśli element text ma wartość null.
- settings
- EncodeSettings
Ustawienia używane do kodowania tekstu.
- fromEnd
- Boolean
Określ, czy indeks ma znajdować się na końcu tekstu.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona lub <parametrmRef name="settings"></paramRef> ma ConsiderNormalization wartość false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Jeśli <parametrmRef name="fromEnd"></paramRef> to false, reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.
Jeśli <parametrmRef name="fromEnd"></paramRef> to true, reprezentuje indeks pierwszego znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie długością tekstu; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie równy zero.
Uwagi
Typy pochodzące z Tokenizer programu mogą zastąpić tę implementację w celu zapewnienia bardziej wydajnej implementacji. Domyślnie używa elementu EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).