Microsoft.ML.Tokenizers Espace de noms

Classes

Nom Description
BertOptions

Options pour le tokenizer Bert.

BertTokenizer

Tokenizer pour le modèle Bert.

BitVector
Bpe

Représente le modèle d’encodage de paire d’octets.

BpeDecoder

Permet de décoder le BPE d’origine en joignant tous les jetons, puis en remplaçant le suffixe utilisé pour identifier les mots de fin de mot par des espaces blancs

BpeTokenizer

Représente le modèle d’encodage de paire d’octets.

BpeTrainer

Le formateur Bpe responsable de l’apprentissage du modèle Bpe.

CodeGenTokenizer

Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer CodeGen décrit dans https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Représente le modèle d’encodage de paire d’octets.

EnglishRobertaTokenizer

Représente le modèle d’encodage de paire d’octets.

LlamaTokenizer

LlamaTokenizer est SentencePieceTokenizer qui est implémenté sur la https://github.com/google/sentencepiecebase .

LowerCaseNormalizer

Normalisez la chaîne en forme minuscule avant de la traiter avec le tokenizer.

Model

Représente un modèle utilisé lors de la tokenisation (par exemple, BPE ou Word Piece ou Unigram).

Normalizer

Normalisez la chaîne avant de la traiter avec le tokenizer.

Phi2Tokenizer

Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer Phi2 décrit dans https://huggingface.co/microsoft/phi-2

PreTokenizer

Classe de base pour toutes les classes de pré-tokenizers. Le PreTokenizer est chargé d’effectuer l’étape de pré-segmentation.

RegexPreTokenizer

Pré-tokenizer pour le tokenizer Tiktoken.

RobertaPreTokenizer

Pre-tokenizer for Roberta English tokenizer.

SentencePieceNormalizer

Normalisez la chaîne en fonction de la normalisation de PhrasePiece.

SentencePieceTokenizer

SentencePieceBpe est un tokenizer qui fractionne l’entrée en jetons à l’aide du modèle PhrasePiece Bpe.

Split

Ce fractionnement contient le jeton de fractionnement sous-jacent ainsi que ses décalages dans la chaîne d’origine. Ces décalages se trouvent dans le original référentiel. Il contient également tous les Token éléments associés au fractionnement actuel.

TiktokenTokenizer

Représente le jeton d’encodage de paire d’octets rapide.

Token

Représentez le jeton généré à partir du processus de jeton contenant la sous-chaîne de jeton, l’ID associé à la sous-chaîne de jeton et le mappage de décalage à la chaîne d’origine.

Tokenizer

Fournit une abstraction pour les tokenizers, ce qui permet l’encodage de texte dans des jetons et le décodage des ID de jetons en texte.

TokenizerDecoder

Un décodeur a la responsabilité de fusionner la liste donnée de jetons dans une chaîne.

TokenizerResult

L’encodage représente la sortie d’un tokenizer.

Trainer

A Trainer la responsabilité d’entraîner un modèle. Nous l’alimentons avec des lignes/phrases, puis il peut entraîner le donné Model.

UpperCaseNormalizer

Normalisez la chaîne en forme majuscule avant de la traiter avec le tokenizer.

WhiteSpace

Pré-tokeniseur qui fractionne le texte à la limite du mot. Le mot est un ensemble d’alphabets, de caractères numériques et de trait de soulignement.

WordPieceOptions

Options du tokenizer WordPiece.

WordPieceTokenizer

Représente le tokenizer WordPiece.

Structures

Nom Description
AddedToken

Représentez un jeton ajouté par l’utilisateur au-dessus du vocabulaire model existant. AddedToken peut être configuré pour spécifier le comportement qu’ils doivent avoir dans différentes situations telles que :

  • S’ils ne doivent correspondre qu’à des mots uniques
  • Indique s’il faut inclure un Espace blanc sur sa gauche ou sa droite
EncodedToken

Représentez le jeton généré à partir du processus de jeton contenant la sous-chaîne de jeton, l’ID associé à la sous-chaîne de jeton et le mappage de décalage à la chaîne d’origine.

EncodeResults<T>

Résultat de l’encodage d’un texte.

EncodeSettings

Paramètres utilisés pour encoder un texte.

NormalizedString

Contient la chaîne normalisée et le mappage à la chaîne d’origine.

Progress

Énumérations

Nom Description
ProgressState

Représente l’état de la progression signalée.

Délégués

Nom Description
ReportProgress