Microsoft.ML.Tokenizers Espace de noms
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Classes
| Nom | Description |
|---|---|
| BertOptions |
Options pour le tokenizer Bert. |
| BertTokenizer |
Tokenizer pour le modèle Bert. |
| BitVector | |
| Bpe |
Représente le modèle d’encodage de paire d’octets. |
| BpeDecoder |
Permet de décoder le BPE d’origine en joignant tous les jetons, puis en remplaçant le suffixe utilisé pour identifier les mots de fin de mot par des espaces blancs |
| BpeTokenizer |
Représente le modèle d’encodage de paire d’octets. |
| BpeTrainer |
Le formateur Bpe responsable de l’apprentissage du modèle Bpe. |
| CodeGenTokenizer |
Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer CodeGen décrit dans https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Représente le modèle d’encodage de paire d’octets. |
| EnglishRobertaTokenizer |
Représente le modèle d’encodage de paire d’octets. |
| LlamaTokenizer |
LlamaTokenizer est SentencePieceTokenizer qui est implémenté sur la https://github.com/google/sentencepiecebase . |
| LowerCaseNormalizer |
Normalisez la chaîne en forme minuscule avant de la traiter avec le tokenizer. |
| Model |
Représente un modèle utilisé lors de la tokenisation (par exemple, BPE ou Word Piece ou Unigram). |
| Normalizer |
Normalisez la chaîne avant de la traiter avec le tokenizer. |
| Phi2Tokenizer |
Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer Phi2 décrit dans https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Classe de base pour toutes les classes de pré-tokenizers. Le PreTokenizer est chargé d’effectuer l’étape de pré-segmentation. |
| RegexPreTokenizer |
Pré-tokenizer pour le tokenizer Tiktoken. |
| RobertaPreTokenizer |
Pre-tokenizer for Roberta English tokenizer. |
| SentencePieceNormalizer |
Normalisez la chaîne en fonction de la normalisation de PhrasePiece. |
| SentencePieceTokenizer |
SentencePieceBpe est un tokenizer qui fractionne l’entrée en jetons à l’aide du modèle PhrasePiece Bpe. |
| Split |
Ce fractionnement contient le jeton de fractionnement sous-jacent ainsi que ses décalages dans la chaîne d’origine. Ces décalages se trouvent dans le |
| TiktokenTokenizer |
Représente le jeton d’encodage de paire d’octets rapide. |
| Token |
Représentez le jeton généré à partir du processus de jeton contenant la sous-chaîne de jeton, l’ID associé à la sous-chaîne de jeton et le mappage de décalage à la chaîne d’origine. |
| Tokenizer |
Fournit une abstraction pour les tokenizers, ce qui permet l’encodage de texte dans des jetons et le décodage des ID de jetons en texte. |
| TokenizerDecoder |
Un décodeur a la responsabilité de fusionner la liste donnée de jetons dans une chaîne. |
| TokenizerResult |
L’encodage représente la sortie d’un tokenizer. |
| Trainer |
A |
| UpperCaseNormalizer |
Normalisez la chaîne en forme majuscule avant de la traiter avec le tokenizer. |
| WhiteSpace |
Pré-tokeniseur qui fractionne le texte à la limite du mot. Le mot est un ensemble d’alphabets, de caractères numériques et de trait de soulignement. |
| WordPieceOptions |
Options du tokenizer WordPiece. |
| WordPieceTokenizer |
Représente le tokenizer WordPiece. |
Structures
| Nom | Description |
|---|---|
| AddedToken |
Représentez un jeton ajouté par l’utilisateur au-dessus du vocabulaire model existant. AddedToken peut être configuré pour spécifier le comportement qu’ils doivent avoir dans différentes situations telles que :
|
| EncodedToken |
Représentez le jeton généré à partir du processus de jeton contenant la sous-chaîne de jeton, l’ID associé à la sous-chaîne de jeton et le mappage de décalage à la chaîne d’origine. |
| EncodeResults<T> |
Résultat de l’encodage d’un texte. |
| EncodeSettings |
Paramètres utilisés pour encoder un texte. |
| NormalizedString |
Contient la chaîne normalisée et le mappage à la chaîne d’origine. |
| Progress | |
Énumérations
| Nom | Description |
|---|---|
| ProgressState |
Représente l’état de la progression signalée. |
Délégués
| Nom | Description |
|---|---|
| ReportProgress | |