Microsoft.ML.Tokenizers Espacio de nombres

Clases

Nombre Description
BertOptions

Opciones para el tokenizador Bert.

BertTokenizer

Tokenizador para el modelo bert.

BitVector
Bpe

Representa el modelo de codificación de pares de bytes.

BpeDecoder

Permite descodificar el BPE original mediante la combinación de todos los tokens y, a continuación, reemplazando el sufijo usado para identificar palabras finales por espacios en blanco.

BpeTokenizer

Representa el modelo de codificación de pares de bytes.

BpeTrainer

El entrenador de Bpe responsable de entrenar el modelo Bpe.

CodeGenTokenizer

Representa el modelo de codificación de pares de bytes. Implementación del tokenizador de CodeGen descrito en https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Representa el modelo de codificación de pares de bytes.

EnglishRobertaTokenizer

Representa el modelo de codificación de pares de bytes.

LlamaTokenizer

LlamaTokenizer es SentencePieceTokenizer, que se implementa en función de https://github.com/google/sentencepiece.

LowerCaseNormalizer

Normalice la cadena en formato en minúsculas antes de procesarla con el tokenizador.

Model

Representa un modelo usado durante la tokenización (como BPE o Word Fragmento o Unigrama).

Normalizer

Normalice la cadena antes de procesarla con el tokenizador.

Phi2Tokenizer

Representa el modelo de codificación de pares de bytes. Implementación del tokenizador Phi2 descrito en https://huggingface.co/microsoft/phi-2

PreTokenizer

Clase base para todas las clases de tokenizadores previos. PreTokenizer se encarga de realizar el paso de segmentación previa.

RegexPreTokenizer

Tokenizador previo para tokenizador Tiktoken.

RobertaPreTokenizer

Tokenizador previo para el tokenizador en inglés de Roberta.

SentencePieceNormalizer

Normalice la cadena según la normalización de SentencePiece.

SentencePieceTokenizer

SentencePieceBpe es un tokenizador que divide la entrada en tokens mediante el modelo de SentencePiece Bpe.

Split

Esta división contiene el token de división subyacente, así como sus desplazamientos en la cadena original. Estos desplazamientos están en el original referencial. También contiene cualquier Token asociado a la división actual.

TiktokenTokenizer

Representa el tokenizador de codificación de par de bytes rápido.

Token

Representa el token generado a partir del proceso de tokenización que contiene la subcadena del token, el identificador asociado a la subcadena del token y la asignación de desplazamiento a la cadena original.

Tokenizer

Proporciona una abstracción para los tokenizadores, lo que permite la codificación de texto en tokens y la descodificación de identificadores de token en texto.

TokenizerDecoder

Un descodificador tiene la responsabilidad de combinar la lista especificada de tokens en una cadena.

TokenizerResult

La codificación representa la salida de un tokenizador.

Trainer

Tiene Trainer la responsabilidad de entrenar un modelo. Lo alimentamos con líneas y oraciones y, a continuación, puede entrenar el dado Model.

UpperCaseNormalizer

Normalice la cadena en formato en mayúsculas antes de procesarla con el tokenizador.

WhiteSpace

Pre-tokenizer que divide el texto en el límite de la palabra. La palabra es un conjunto de caracteres alfabéticos, numéricos y de subrayado.

WordPieceOptions

Opciones para el tokenizador de WordPiece.

WordPieceTokenizer

Representa el tokenizador de WordPiece.

Estructuras

Nombre Description
AddedToken

Representa un token agregado por el usuario sobre el vocabulario del modelo existente. AddedToken se puede configurar para especificar el comportamiento que deben tener en varias situaciones como:

  • Si solo deben coincidir con palabras únicas
  • Si se debe incluir cualquier espacio en blanco a la izquierda o a la derecha
EncodedToken

Representa el token generado a partir del proceso de tokenización que contiene la subcadena del token, el identificador asociado a la subcadena del token y la asignación de desplazamiento a la cadena original.

EncodeResults<T>

Resultado de la codificación de un texto.

EncodeSettings

La configuración usada para codificar un texto.

NormalizedString

Contiene la cadena normalizada y la asignación a la cadena original.

Progress

Enumeraciones

Nombre Description
ProgressState

Representa el estado del progreso notificado.

Delegados

Nombre Description
ReportProgress