CodeGenTokenizer.EncodeToIds Método
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Sobrecargas
| Nome | Description |
|---|---|
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens. |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens. |
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- String
O texto a ser codificado.
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.
- charsConsumed
- Int32
O comprimento do texto que abrange o máximo de tokens codificados.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Codifica o texto de entrada em IDs de tokens.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- String
O texto a ser codificado.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.
- charsConsumed
- Int32
O comprimento do texto que abrange o máximo de tokens codificados.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.
Aplica-se a
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Codifica o texto de entrada em IDs de token.
protected override Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overrides Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)
Parâmetros
- text
- String
O texto a ser codificado.
- textSpan
- ReadOnlySpan<Char>
O intervalo do texto a ser codificado, que será usado se for textnull.
- settings
- EncodeSettings
As configurações usadas para codificar o texto.
Retornos
Os resultados codificados que contêm a lista de IDs codificadas.
Aplica-se a
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Codifica o texto de entrada em IDs de tokens.
public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
A lista de IDs codificadas.