Microsoft.ML.Tokenizers Namespace

Classes

Nome Description
BertOptions

Opções para o tokenizador Bert.

BertTokenizer

Tokenizer para o modelo Bert.

BitVector
Bpe

Represente o modelo de codificação de par de bytes.

BpeDecoder

Permite a decodificação do BPE Original unindo todos os tokens e, em seguida, substituindo o sufixo usado para identificar o fim das palavras por espaços em branco

BpeTokenizer

Represente o modelo de codificação de par de bytes.

BpeTrainer

O treinador do Bpe responsável por treinar o modelo bpe.

CodeGenTokenizer

Represente o modelo de codificação de par de bytes. Implementar o tokenizer CodeGen descrito em https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Represente o modelo de codificação de par de bytes.

EnglishRobertaTokenizer

Represente o modelo de codificação de par de bytes.

LlamaTokenizer

LlamaTokenizer é SentencePieceTokenizer, que é implementado com base em https://github.com/google/sentencepiece.

LowerCaseNormalizer

Normalize a cadeia de caracteres para forma minúscula antes de processá-la com o tokenizador.

Model

Representa um modelo usado durante a Tokenização (como BPE ou Word Piece ou Unigram).

Normalizer

Normalize a cadeia de caracteres antes de processá-la com o tokenizador.

Phi2Tokenizer

Represente o modelo de codificação de par de bytes. Implementar o tokenizador Phi2 descrito em https://huggingface.co/microsoft/phi-2

PreTokenizer

Classe base para todas as classes pré-tokenizadores. O PreTokenizer é responsável por executar a etapa de pré-segmentação.

RegexPreTokenizer

O pré-tokenizador para o tokenizador Tiktoken.

RobertaPreTokenizer

O pré-tokenizador para roberta tokenizer inglês.

SentencePieceNormalizer

Normalize a cadeia de caracteres de acordo com a normalização de SentencePiece.

SentencePieceTokenizer

SentencePieceBpe é um tokenizador que divide a entrada em tokens usando o modelo SentencePiece Bpe.

Split

Essa Divisão contém o token de divisão subjacente, bem como seus deslocamentos na cadeia de caracteres original. Esses deslocamentos estão no original referencial. Ele também contém qualquer Token associado à divisão atual.

TiktokenTokenizer

Represente o token de codificação de par de bytes rápido.

Token

Represente o token produzido a partir do processo de tokenização que contém a subcadeia de caracteres de token, a ID associada à subcadeia de caracteres do token e o mapeamento de deslocamento para a cadeia de caracteres original.

Tokenizer

Fornece uma abstração para tokenizadores, permitindo a codificação de texto em tokens e a decodificação de IDs de token de volta ao texto.

TokenizerDecoder

Um Decodificador tem a responsabilidade de mesclar a lista de tokens fornecida em uma cadeia de caracteres.

TokenizerResult

A codificação representa a saída de um Tokenizer.

Trainer

A Trainer tem a responsabilidade de treinar um modelo. Nós o alimentamos com linhas/frases e, em seguida, ele pode treinar o determinado Model.

UpperCaseNormalizer

Normalize a cadeia de caracteres para forma maiúscula antes de processá-la com o tokenizador.

WhiteSpace

O pré-tokenizador que divide o texto no limite da palavra. A palavra é um conjunto de caracteres alfabeto, numéricos e sublinhados.

WordPieceOptions

Opções para o tokenizador wordpiece.

WordPieceTokenizer

Represente o tokenizador wordpiece.

Estruturas

Nome Description
AddedToken

Represente um token adicionado pelo usuário sobre o vocabulário do Modelo existente. AddedToken pode ser configurado para especificar o comportamento que eles devem ter em várias situações, como:

  • Se elas devem corresponder apenas a palavras simples
  • Se deseja incluir qualquer WhiteSpace à esquerda ou à direita
EncodedToken

Represente o token produzido a partir do processo de tokenização que contém a subcadeia de caracteres de token, a ID associada à subcadeia de caracteres do token e o mapeamento de deslocamento para a cadeia de caracteres original.

EncodeResults<T>

O resultado da codificação de um texto.

EncodeSettings

As configurações usadas para codificar um texto.

NormalizedString

Contém a cadeia de caracteres normalizada e o mapeamento para a cadeia de caracteres original.

Progress

Enumerações

Nome Description
ProgressState

Represente o estado do progresso relatado.

Delegados

Nome Description
ReportProgress