Microsoft.ML.Tokenizers Espacio de nombres
Importante
Parte de la información hace referencia a la versión preliminar del producto, que puede haberse modificado sustancialmente antes de lanzar la versión definitiva. Microsoft no otorga ninguna garantía, explícita o implícita, con respecto a la información proporcionada aquí.
Clases
| Nombre | Description |
|---|---|
| BertOptions |
Opciones para el tokenizador Bert. |
| BertTokenizer |
Tokenizador para el modelo bert. |
| BitVector | |
| Bpe |
Representa el modelo de codificación de pares de bytes. |
| BpeDecoder |
Permite descodificar el BPE original mediante la combinación de todos los tokens y, a continuación, reemplazando el sufijo usado para identificar palabras finales por espacios en blanco. |
| BpeTokenizer |
Representa el modelo de codificación de pares de bytes. |
| BpeTrainer |
El entrenador de Bpe responsable de entrenar el modelo Bpe. |
| CodeGenTokenizer |
Representa el modelo de codificación de pares de bytes. Implementación del tokenizador de CodeGen descrito en https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Representa el modelo de codificación de pares de bytes. |
| EnglishRobertaTokenizer |
Representa el modelo de codificación de pares de bytes. |
| LlamaTokenizer |
LlamaTokenizer es SentencePieceTokenizer, que se implementa en función de https://github.com/google/sentencepiece. |
| LowerCaseNormalizer |
Normalice la cadena en formato en minúsculas antes de procesarla con el tokenizador. |
| Model |
Representa un modelo usado durante la tokenización (como BPE o Word Fragmento o Unigrama). |
| Normalizer |
Normalice la cadena antes de procesarla con el tokenizador. |
| Phi2Tokenizer |
Representa el modelo de codificación de pares de bytes. Implementación del tokenizador Phi2 descrito en https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Clase base para todas las clases de tokenizadores previos. PreTokenizer se encarga de realizar el paso de segmentación previa. |
| RegexPreTokenizer |
Tokenizador previo para tokenizador Tiktoken. |
| RobertaPreTokenizer |
Tokenizador previo para el tokenizador en inglés de Roberta. |
| SentencePieceNormalizer |
Normalice la cadena según la normalización de SentencePiece. |
| SentencePieceTokenizer |
SentencePieceBpe es un tokenizador que divide la entrada en tokens mediante el modelo de SentencePiece Bpe. |
| Split |
Esta división contiene el token de división subyacente, así como sus desplazamientos en la cadena original. Estos desplazamientos están en el |
| TiktokenTokenizer |
Representa el tokenizador de codificación de par de bytes rápido. |
| Token |
Representa el token generado a partir del proceso de tokenización que contiene la subcadena del token, el identificador asociado a la subcadena del token y la asignación de desplazamiento a la cadena original. |
| Tokenizer |
Proporciona una abstracción para los tokenizadores, lo que permite la codificación de texto en tokens y la descodificación de identificadores de token en texto. |
| TokenizerDecoder |
Un descodificador tiene la responsabilidad de combinar la lista especificada de tokens en una cadena. |
| TokenizerResult |
La codificación representa la salida de un tokenizador. |
| Trainer |
Tiene |
| UpperCaseNormalizer |
Normalice la cadena en formato en mayúsculas antes de procesarla con el tokenizador. |
| WhiteSpace |
Pre-tokenizer que divide el texto en el límite de la palabra. La palabra es un conjunto de caracteres alfabéticos, numéricos y de subrayado. |
| WordPieceOptions |
Opciones para el tokenizador de WordPiece. |
| WordPieceTokenizer |
Representa el tokenizador de WordPiece. |
Estructuras
| Nombre | Description |
|---|---|
| AddedToken |
Representa un token agregado por el usuario sobre el vocabulario del modelo existente. AddedToken se puede configurar para especificar el comportamiento que deben tener en varias situaciones como:
|
| EncodedToken |
Representa el token generado a partir del proceso de tokenización que contiene la subcadena del token, el identificador asociado a la subcadena del token y la asignación de desplazamiento a la cadena original. |
| EncodeResults<T> |
Resultado de la codificación de un texto. |
| EncodeSettings |
La configuración usada para codificar un texto. |
| NormalizedString |
Contiene la cadena normalizada y la asignación a la cadena original. |
| Progress | |
Enumeraciones
| Nombre | Description |
|---|---|
| ProgressState |
Representa el estado del progreso notificado. |
Delegados
| Nombre | Description |
|---|---|
| ReportProgress | |