Microsoft.ML.Tokenizers Namespace
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Classes
| Nome | Description |
|---|---|
| BertOptions |
Opções para o tokenizador Bert. |
| BertTokenizer |
Tokenizer para o modelo Bert. |
| BitVector | |
| Bpe |
Represente o modelo de codificação de par de bytes. |
| BpeDecoder |
Permite a decodificação do BPE Original unindo todos os tokens e, em seguida, substituindo o sufixo usado para identificar o fim das palavras por espaços em branco |
| BpeTokenizer |
Represente o modelo de codificação de par de bytes. |
| BpeTrainer |
O treinador do Bpe responsável por treinar o modelo bpe. |
| CodeGenTokenizer |
Represente o modelo de codificação de par de bytes. Implementar o tokenizer CodeGen descrito em https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Represente o modelo de codificação de par de bytes. |
| EnglishRobertaTokenizer |
Represente o modelo de codificação de par de bytes. |
| LlamaTokenizer |
LlamaTokenizer é SentencePieceTokenizer, que é implementado com base em https://github.com/google/sentencepiece. |
| LowerCaseNormalizer |
Normalize a cadeia de caracteres para forma minúscula antes de processá-la com o tokenizador. |
| Model |
Representa um modelo usado durante a Tokenização (como BPE ou Word Piece ou Unigram). |
| Normalizer |
Normalize a cadeia de caracteres antes de processá-la com o tokenizador. |
| Phi2Tokenizer |
Represente o modelo de codificação de par de bytes. Implementar o tokenizador Phi2 descrito em https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Classe base para todas as classes pré-tokenizadores. O PreTokenizer é responsável por executar a etapa de pré-segmentação. |
| RegexPreTokenizer |
O pré-tokenizador para o tokenizador Tiktoken. |
| RobertaPreTokenizer |
O pré-tokenizador para roberta tokenizer inglês. |
| SentencePieceNormalizer |
Normalize a cadeia de caracteres de acordo com a normalização de SentencePiece. |
| SentencePieceTokenizer |
SentencePieceBpe é um tokenizador que divide a entrada em tokens usando o modelo SentencePiece Bpe. |
| Split |
Essa Divisão contém o token de divisão subjacente, bem como seus deslocamentos na cadeia de caracteres original. Esses deslocamentos estão no |
| TiktokenTokenizer |
Represente o token de codificação de par de bytes rápido. |
| Token |
Represente o token produzido a partir do processo de tokenização que contém a subcadeia de caracteres de token, a ID associada à subcadeia de caracteres do token e o mapeamento de deslocamento para a cadeia de caracteres original. |
| Tokenizer |
Fornece uma abstração para tokenizadores, permitindo a codificação de texto em tokens e a decodificação de IDs de token de volta ao texto. |
| TokenizerDecoder |
Um Decodificador tem a responsabilidade de mesclar a lista de tokens fornecida em uma cadeia de caracteres. |
| TokenizerResult |
A codificação representa a saída de um Tokenizer. |
| Trainer |
A |
| UpperCaseNormalizer |
Normalize a cadeia de caracteres para forma maiúscula antes de processá-la com o tokenizador. |
| WhiteSpace |
O pré-tokenizador que divide o texto no limite da palavra. A palavra é um conjunto de caracteres alfabeto, numéricos e sublinhados. |
| WordPieceOptions |
Opções para o tokenizador wordpiece. |
| WordPieceTokenizer |
Represente o tokenizador wordpiece. |
Estruturas
| Nome | Description |
|---|---|
| AddedToken |
Represente um token adicionado pelo usuário sobre o vocabulário do Modelo existente. AddedToken pode ser configurado para especificar o comportamento que eles devem ter em várias situações, como:
|
| EncodedToken |
Represente o token produzido a partir do processo de tokenização que contém a subcadeia de caracteres de token, a ID associada à subcadeia de caracteres do token e o mapeamento de deslocamento para a cadeia de caracteres original. |
| EncodeResults<T> |
O resultado da codificação de um texto. |
| EncodeSettings |
As configurações usadas para codificar um texto. |
| NormalizedString |
Contém a cadeia de caracteres normalizada e o mapeamento para a cadeia de caracteres original. |
| Progress | |
Enumerações
| Nome | Description |
|---|---|
| ProgressState |
Represente o estado do progresso relatado. |
Delegados
| Nome | Description |
|---|---|
| ReportProgress | |