EnglishRobertaTokenizer Clase
Definición
Importante
Parte de la información hace referencia a la versión preliminar del producto, que puede haberse modificado sustancialmente antes de lanzar la versión definitiva. Microsoft no otorga ninguna garantía, explícita o implícita, con respecto a la información proporcionada aquí.
Representa el modelo de codificación de pares de bytes.
public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
- Herencia
Propiedades
| Nombre | Description |
|---|---|
| FilterUnsupportedChars |
Indique si desea filtrar los caracteres no admitidos durante la descodificación. |
| Normalizer |
Obtiene el normalizador en uso por el tokenizador. |
| PadIndex |
Obtiene el índice del símbolo del panel dentro de la lista de símbolos. |
| PreTokenizer |
Obtiene el preTokenizer usado por el tokenizador. |
| SymbolsCount |
Obtiene la longitud de la lista de símbolos. |
| Vocabulary |
Obtiene los tokens de asignación de diccionario a identificadores. |
Métodos
| Nombre | Description |
|---|---|
| AddMaskSymbol(String) |
Agregue el símbolo de máscara a la lista de símbolos. |
| ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>) |
Convierta una lista de identificadores de token en clasificaciones de repetición más altas. |
| ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>) |
Convierta una lista de identificadores de token en valores de repetición más altos. |
| ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>) |
Convierta una lista de clasificaciones de repeticiones más altas en la lista de identificadores de token . |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean) |
Cree el objeto de modelo del tokenizador para usarlo con el modelo robert inglés. |
| Create(Stream, Stream, Stream) |
Cree el objeto de modelo del tokenizador para usarlo con el modelo robert inglés. |
| Create(String, String, String, PreTokenizer, Normalizer, Boolean) |
Cree el objeto de modelo del tokenizador para usarlo con el modelo robert inglés. |
| Create(String, String, String) |
Cree el objeto de modelo del tokenizador para usarlo con el modelo robert inglés. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Descodifique los identificadores especificados de vuelta al texto y almacene el resultado en el |
| Decode(IEnumerable<Int32>) |
Descodifique los identificadores especificados, de vuelta a una cadena. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. (Heredado de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. <param name="text">El texto que se va a codificar.</param> (Heredado de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| IsSupportedChar(Char) |
Compruebe si el carácter es compatible con el modelo del tokenizador. |