Idioma

Tokenizer.EncodeToIds Método

Definição

Sobrecargas

Nome Description
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

<param name="text">O texto a ser codificado.</param>
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

<param name="text">O texto a ser codificado.</param>
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : string * int * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
String
maxTokenCount
Int32

O número máximo de tokens a serem codificados.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

charsConsumed
Int32

A contagem de caracteres do texto que abrange o máximo de tokens codificados.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : ReadOnlySpan<char> * int * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

maxTokenCount
Int32

O número máximo de tokens a serem codificados.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

charsConsumed
Int32

A contagem de caracteres do texto que abrange o máximo de tokens codificados.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Codifica o texto de entrada em IDs de token.

protected virtual Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
abstract member EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overridable Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)

Parâmetros

text
String

O texto a ser codificado.

textSpan
ReadOnlySpan<Char>

O intervalo do texto a ser codificado, que será usado se for textnull.

settings
EncodeSettings

As configurações usadas para codificar o texto.

Retornos

Os resultados codificados que contêm a lista de IDs codificadas.

Comentários

Os tipos derivados Tokenizer podem substituir essa implementação para fornecer uma implementação mais eficiente. Por predefinição, utiliza EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).

Aplica-se a

EncodeToIds(String, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Codifica o texto de entrada em IDs de token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : string * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
String

O texto a ser codificado.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Codifica o texto de entrada em IDs de token.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : ReadOnlySpan<char> * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a