Tokenizer.GetIndexByTokenCount Método
Definición
Importante
Parte de la información hace referencia a la versión preliminar del producto, que puede haberse modificado sustancialmente antes de lanzar la versión definitiva. Microsoft no otorga ninguna garantía, explícita o implícita, con respecto a la información proporcionada aquí.
Sobrecargas
| Nombre | Description |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parámetros
- text
- ReadOnlySpan<Char>
Texto que se va a codificar.
- maxTokenCount
- Int32
Número máximo de tokens que se van a codificar.
- normalizedText
- String
Si la normalización del tokenizador está habilitada o <paramRef name="considerPreTokenization"></paramRef> es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .
- tokenCount
- Int32
El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.
- considerPreTokenization
- Boolean
Indica si se debe tener en cuenta la tokenización previa antes de la tokenización.
- considerNormalization
- Boolean
Indica si se debe considerar la normalización antes de la tokenización.
Devoluciones
Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens.
Representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada.
Se aplica a
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parámetros
- text
- String
Texto que se va a codificar.
- maxTokenCount
- Int32
Número máximo de tokens que se van a codificar.
- normalizedText
- String
Si la normalización del tokenizador está habilitada o <paramRef name="considerNormalization"></paramRef> es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .
- tokenCount
- Int32
El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.
- considerPreTokenization
- Boolean
Indica si se debe tener en cuenta la tokenización previa antes de la tokenización.
- considerNormalization
- Boolean
Indica si se debe considerar la normalización antes de la tokenización.
Devoluciones
Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens.
Representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada.
Se aplica a
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
- Source:
- Tokenizer.cs
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parámetros
- text
- String
Texto que se va a codificar.
- textSpan
- ReadOnlySpan<Char>
Intervalo del texto que se va a codificar, que se usará si text es null.
- settings
- EncodeSettings
Configuración que se usa para codificar el texto.
- fromEnd
- Boolean
Indica si se va a buscar el índice desde el final del texto.
- normalizedText
- String
Si la normalización del tokenizador está habilitada o <paramRef name="settings"></paramRef> tiene ConsiderNormalization es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .
- tokenCount
- Int32
El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.
Devoluciones
Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens.
Si <paramRef name="fromEnd"></paramRef> es false, representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada.
Si <paramRef name="fromEnd"></paramRef> es true, representa el índice del primer carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será la longitud del texto; por el contrario, si todos los tokens encajan, el resultado será cero.
Comentarios
Los tipos derivados de Tokenizer pueden invalidar esta implementación para proporcionar una implementación más eficaz. De forma predeterminada, usa EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).