CodeGenTokenizer.GetIndexByTokenCount Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Przeciążenia
| Nazwa | Opis |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametry
- text
- ReadOnlySpan<Char>
Tekst do zakodowania.
- maxTokenCount
- Int32
Maksymalna liczba tokenów w celu ograniczenia pojemności kodowania.
- addPrefixSpace
- Boolean
Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.
- addBeginningOfSentence
- Boolean
Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.
- addEndOfSentence
- Boolean
Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona, tekst wejściowy będzie reprezentowany w postaci normalizacji; w przeciwnym razie będzie mieć wartość null.
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
- considerPreTokenization
- Boolean
Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.
- considerNormalization
- Boolean
Określ, czy należy rozważyć normalizację przed tokenizacją.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu lub normalizedText jeśli normalizacja jest włączona.
Dotyczy
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.
protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parametry
- text
- String
Tekst do zakodowania.
- textSpan
- ReadOnlySpan<Char>
Zakres tekstu do zakodowania, który będzie używany, jeśli element text ma wartość null.
- settings
- EncodeSettings
Ustawienia używane do kodowania tekstu.
- fromEnd
- Boolean
Określ, czy indeks ma znajdować się na końcu tekstu.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona lub <parametrmRef name="settings"></paramRef> ma ConsiderNormalization wartość false, zostanie ustawiona <wartość paramRef name="text"></paramRef> w znormalizowanej postaci; w przeciwnym razie ta wartość zostanie ustawiona na nullwartość .
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Jeśli <parametrmRef name="fromEnd"></paramRef> to false, reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu wejściowego lub normalizedText jeśli normalizacja jest włączona.
Jeśli <parametrmRef name="fromEnd"></paramRef> to true, reprezentuje indeks pierwszego znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie długością tekstu; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie równy zero.
Dotyczy
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
- Źródło:
- CodeGenTokenizer.cs
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.
public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parametry
- text
- String
Tekst do zakodowania.
- maxTokenCount
- Int32
Maksymalna liczba tokenów w celu ograniczenia pojemności kodowania.
- addPrefixSpace
- Boolean
Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.
- addBeginningOfSentence
- Boolean
Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.
- addEndOfSentence
- Boolean
Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.
- normalizedText
- String
Jeśli normalizacja tokenizatora jest włączona, tekst wejściowy będzie reprezentowany w postaci normalizacji; w przeciwnym razie będzie mieć wartość null.
- tokenCount
- Int32
Liczbę tokenów można wygenerować, która powinna być mniejsza niż maksymalna liczba tokenów.
- considerPreTokenization
- Boolean
Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.
- considerNormalization
- Boolean
Określ, czy należy rozważyć normalizację przed tokenizacją.
Zwraca
Indeks maksymalnej pojemności kodowania w przetworzonym tekście bez przekraczania limitu tokenu.
Reprezentuje indeks bezpośrednio po ostatnim znaku, który ma zostać uwzględniony. W przypadkach, gdy tokeny nie pasują, wynik będzie 0; z drugiej strony, jeśli wszystkie tokeny pasują, wynik będzie mieć długość tekstu lub normalizedText jeśli normalizacja jest włączona.