Tokenizer.EncodeToIds Método
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Sobrecargas
| Nome | Description |
|---|---|
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. <param name="text">O texto a ser codificado.</param> |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Codifica o texto de entrada para IDs de token até o número máximo de tokens.
<param name="text">O texto a ser codificado.</param>public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : string * int * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- String
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- charsConsumed
- Int32
A contagem de caracteres do texto que abrange o máximo de tokens codificados.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Codifica o texto de entrada para IDs de token até o número máximo de tokens.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : ReadOnlySpan<char> * int * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- charsConsumed
- Int32
A contagem de caracteres do texto que abrange o máximo de tokens codificados.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Codifica o texto de entrada em IDs de token.
protected virtual Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
abstract member EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overridable Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)
Parâmetros
- text
- String
O texto a ser codificado.
- textSpan
- ReadOnlySpan<Char>
O intervalo do texto a ser codificado, que será usado se for textnull.
- settings
- EncodeSettings
As configurações usadas para codificar o texto.
Retornos
Os resultados codificados que contêm a lista de IDs codificadas.
Comentários
Os tipos derivados Tokenizer podem substituir essa implementação para fornecer uma implementação mais eficiente. Por predefinição, utiliza EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).
Aplica-se a
EncodeToIds(String, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Codifica o texto de entrada em IDs de token.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : string * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- String
O texto a ser codificado.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Codifica o texto de entrada em IDs de token.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool considerPreTokenization = true, bool considerNormalization = true);
member this.EncodeToIds : ReadOnlySpan<char> * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.