BpeTokenizer Clase
Definición
Importante
Parte de la información hace referencia a la versión preliminar del producto, que puede haberse modificado sustancialmente antes de lanzar la versión definitiva. Microsoft no otorga ninguna garantía, explícita o implícita, con respecto a la información proporcionada aquí.
Representa el modelo de codificación de pares de bytes.
public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
- Herencia
Propiedades
| Nombre | Description |
|---|---|
| ContinuingSubwordPrefix |
Prefijo que se va a usar para cada subword que no es un principio de palabra |
| EndOfWordSuffix |
Un sufijo opcional para caracterizar y finalizar la sub-palabra |
| FuseUnknownTokens |
Obtiene o establece si se permiten varios tokens desconocidos se fusionan. |
| Normalizer |
Obtiene el normalizador en uso por el tokenizador. |
| PreTokenizer |
Obtiene el preTokenizer usado por el tokenizador. |
| SpecialTokens |
Obtiene los tokens especiales. |
| UnknownToken |
Obtiene o establece un token desconocido. El token desconocido que se va a usar cuando se encuentra un char desconocido |
| Vocabulary |
Obtiene los tokens de asignación de diccionario a identificadores. |
Métodos
| Nombre | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenga el número de tokens en los que se codificará el texto de entrada. (Heredado de Tokenizer) |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Cree un nuevo objeto de tokenizador Bpe que se usará para la codificación de texto. |
| Create(Stream, Stream) |
Cree un nuevo objeto de tokenizador Bpe que se usará para la codificación de texto. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Cree un nuevo objeto de tokenizador Bpe que se usará para la codificación de texto. |
| Create(String, String) |
Cree un nuevo objeto de tokenizador Bpe que se usará para la codificación de texto. |
| CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Cree un nuevo objeto de tokenizador Bpe de forma asincrónica para usarlo para la codificación de texto. |
| Decode(IEnumerable<Int32>, Boolean) |
Descodifique los identificadores especificados, de vuelta a una cadena. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Descodifique los identificadores especificados de vuelta al texto y almacene el resultado en el |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Descodifique los identificadores especificados de vuelta al texto y almacene el resultado en el |
| Decode(IEnumerable<Int32>) |
Descodifique los identificadores especificados, de vuelta a una cadena. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. (Heredado de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. <param name="text">El texto que se va a codificar.</param> (Heredado de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en identificadores de token. (Heredado de Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. (Heredado de Tokenizer) |