Tokenizer.GetIndexByTokenCount Método

Definición

Sobrecargas

Nombre Description
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Source:
Tokenizer.cs
Source:
Tokenizer.cs
Source:
Tokenizer.cs

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parámetros

text
ReadOnlySpan<Char>

Texto que se va a codificar.

maxTokenCount
Int32

Número máximo de tokens que se van a codificar.

normalizedText
String

Si la normalización del tokenizador está habilitada o <paramRef name="considerPreTokenization"></paramRef> es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .

tokenCount
Int32

El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.

considerPreTokenization
Boolean

Indica si se debe tener en cuenta la tokenización previa antes de la tokenización.

considerNormalization
Boolean

Indica si se debe considerar la normalización antes de la tokenización.

Devoluciones

Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens. Representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada.

Se aplica a

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Source:
Tokenizer.cs
Source:
Tokenizer.cs
Source:
Tokenizer.cs

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parámetros

text
String

Texto que se va a codificar.

maxTokenCount
Int32

Número máximo de tokens que se van a codificar.

normalizedText
String

Si la normalización del tokenizador está habilitada o <paramRef name="considerNormalization"></paramRef> es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .

tokenCount
Int32

El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.

considerPreTokenization
Boolean

Indica si se debe tener en cuenta la tokenización previa antes de la tokenización.

considerNormalization
Boolean

Indica si se debe considerar la normalización antes de la tokenización.

Devoluciones

Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens. Representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada.

Se aplica a

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Source:
Tokenizer.cs
Source:
Tokenizer.cs
Source:
Tokenizer.cs

Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens.

protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parámetros

text
String

Texto que se va a codificar.

textSpan
ReadOnlySpan<Char>

Intervalo del texto que se va a codificar, que se usará si text es null.

settings
EncodeSettings

Configuración que se usa para codificar el texto.

fromEnd
Boolean

Indica si se va a buscar el índice desde el final del texto.

normalizedText
String

Si la normalización del tokenizador está habilitada o <paramRef name="settings"></paramRef> tiene ConsiderNormalization es false, se establecerá <en paramRef name="text"></paramRef> en su forma normalizada; de lo contrario, este valor se establecerá nullen .

tokenCount
Int32

El recuento de tokens se puede generar que debe ser menor que el número máximo de tokens.

Devoluciones

Índice de la capacidad de codificación máxima dentro del texto procesado sin superar el límite de tokens. Si <paramRef name="fromEnd"></paramRef> es false, representa el índice inmediatamente después del último carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será 0; por el contrario, si todos los tokens caben, el resultado será la longitud del texto de entrada o si normalizedText la normalización está habilitada. Si <paramRef name="fromEnd"></paramRef> es true, representa el índice del primer carácter que se va a incluir. En los casos en los que no caben tokens, el resultado será la longitud del texto; por el contrario, si todos los tokens encajan, el resultado será cero.

Comentarios

Los tipos derivados de Tokenizer pueden invalidar esta implementación para proporcionar una implementación más eficaz. De forma predeterminada, usa EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).

Se aplica a