Tokenizer Clase
Definición
Importante
Parte de la información hace referencia a la versión preliminar del producto, que puede haberse modificado sustancialmente antes de lanzar la versión definitiva. Microsoft no otorga ninguna garantía, explícita o implícita, con respecto a la información proporcionada aquí.
Proporciona una abstracción para los tokenizadores, lo que permite la codificación de texto en tokens y la descodificación de identificadores de token en texto.
public abstract class Tokenizer
public class Tokenizer
type Tokenizer = class
Public MustInherit Class Tokenizer
Public Class Tokenizer
- Herencia
-
Tokenizer
- Derivado
Constructores
| Nombre | Description |
|---|---|
| Tokenizer() |
Inicializa una nueva instancia de la clase Tokenizer. |
| Tokenizer(Model, PreTokenizer, Normalizer) |
Cree un nuevo objeto Tokenizer. |
Propiedades
| Nombre | Description |
|---|---|
| Decoder |
Obtiene o establece el descodificador en uso por el tokenizador. |
| Model |
Obtiene el modelo en uso por el tokenizador. |
| Normalizer |
Obtiene el normalizador en uso por el tokenizador. |
| PreTokenizer |
Obtiene el preTokenizer usado por el tokenizador. |
Métodos
| Nombre | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. |
| CountTokens(String, Boolean, Boolean) |
Obtenga el número de tokens en los que se codificará el texto de entrada. |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenga el número de tokens en los que se codificará el texto de entrada. |
| Decode(IEnumerable<Int32>, Boolean) |
Descodifique los identificadores especificados, de vuelta a una cadena. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Descodifique los identificadores especificados de vuelta al texto y almacene el resultado en el |
| Decode(IEnumerable<Int32>) |
Descodifique los identificadores especificados, de vuelta a una cadena. |
| Decode(Int32, Boolean) |
Descodifica el identificador en el token asignado. |
| Encode(String) |
Codifica el texto de entrada en el objeto tiene la lista de tokens, identificadores de tokens, asignación de desplazamiento de tokens. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. |
| EncodeToIds(String, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica el texto de entrada en identificadores de token hasta el número máximo de tokens. <param name="text">El texto que se va a codificar.</param> |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en identificadores de token. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica el texto de entrada en una lista de EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica el texto de entrada en una lista de EncodedTokens. |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Busque el índice de la capacidad de codificación máxima sin superar el límite de tokens. |
| TrainFromFiles(Trainer, ReportProgress, String[]) |
Entrene el modelo de tokenizador mediante archivos de entrada. |