BertTokenizer Classe
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Tokenizer pour le modèle Bert.
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- Héritage
Remarques
Le BertTokenizer est basé sur le WordPieceTokenizer et est utilisé pour tokeniser du texte pour les modèles Bert. L’implémentation de BertTokenizer est basée sur l’implémentation initiale de Bert dans la bibliothèque Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
Propriétés
| Nom | Description |
|---|---|
| ApplyBasicTokenization |
Obtient une valeur indiquant si le tokenizer doit effectuer une tokenisation de base. Comme le texte propre, normalisez-le, réduisez-le, etc. |
| ClassificationToken |
Obtient le jeton de classifieur qui est utilisé lors de la classification de séquence (classification de l’ensemble de la séquence au lieu de la classification par jeton). Il s’agit du premier jeton de la séquence lorsqu’elle est générée avec des jetons spéciaux. |
| ClassificationTokenId |
Obtient l’ID de jeton de classifieur |
| ContinuingSubwordPrefix |
Obtient le préfixe à utiliser pour les sous-mots qui ne sont pas la première partie d’un mot. (Hérité de WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
Obtient une valeur indiquant si le tokenizer doit fractionner les caractères CJK en jetons. |
| LowerCaseBeforeTokenization |
Obtient une valeur indiquant si le tokenizer doit minusculer le texte d’entrée. |
| MaskingToken |
Obtient le jeton de masque utilisé pour masquer les valeurs. Il s’agit du jeton utilisé lors de l’apprentissage de ce modèle avec la modélisation du langage masqué. Il s’agit du jeton que le modèle tentera de prédire. |
| MaskingTokenId |
Obtient l’ID du jeton de masque |
| MaxInputCharsPerWord |
Obtient le nombre maximal de caractères à autoriser dans un mot unique. (Hérité de WordPieceTokenizer) |
| Normalizer |
Obtient le normaliseur en cours d’utilisation par le tokenizer. (Hérité de WordPieceTokenizer) |
| PaddingToken |
Obtient le jeton utilisé pour le remplissage, par exemple lors du traitement par lots de séquences de longueurs différentes |
| PaddingTokenId |
Obtient l’ID du jeton de remplissage |
| PreTokenizer |
Obtient le PreTokenizer utilisé par le tokenizer. (Hérité de WordPieceTokenizer) |
| RemoveNonSpacingMarks |
Obtient une valeur indiquant s’il faut supprimer des marques d’interligne. |
| SeparatorToken |
Obtient le jeton de séparation, qui est utilisé lors de la génération d’une séquence à partir de plusieurs séquences, par exemple deux séquences pour la classification de séquences ou pour un texte et une question pour répondre aux questions. Il est également utilisé comme dernier jeton d’une séquence créée avec des jetons spéciaux. |
| SeparatorTokenId |
Obtient l’ID du jeton de séparation |
| SpecialTokens |
Obtient les jetons spéciaux et leurs ID correspondants. (Hérité de WordPieceTokenizer) |
| SplitOnSpecialTokens |
Obtient une valeur indiquant si le tokenizer doit être fractionné sur les jetons spéciaux ou traiter des jetons spéciaux comme du texte normal. |
| UnknownToken |
Obtient le jeton inconnu. Un jeton qui n’est pas dans le vocabulaire ne peut pas être converti en ID et est défini comme ce jeton à la place. (Hérité de WordPieceTokenizer) |
| UnknownTokenId |
Obtient l’ID de jeton inconnu. Un jeton qui n’est pas dans le vocabulaire ne peut pas être converti en ID et est défini comme ce jeton à la place. (Hérité de WordPieceTokenizer) |
Méthodes
| Nom | Description |
|---|---|
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>) |
Générez des entrées de modèle à partir d’une séquence ou d’une paire de séquences pour les tâches de classification de séquence en concaténant et en ajoutant des jetons spéciaux. Une séquence BERT a le format suivant : - séquence unique : |
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Générez des entrées de modèle à partir d’une séquence ou d’une paire de séquences pour les tâches de classification de séquence en concaténant et en ajoutant des jetons spéciaux. Une séquence BERT a le format suivant : - séquence unique : |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de WordPieceTokenizer) |
| Create(Stream, BertOptions) |
Créez une instance de la classe BertTokenizer. |
| Create(String, BertOptions) |
Créez une instance de la classe BertTokenizer. |
| CreateAsync(Stream, BertOptions, CancellationToken) |
Créez une instance de la BertTokenizer classe de façon asynchrone. |
| CreateAsync(String, BertOptions, CancellationToken) |
Créez une instance de la BertTokenizer classe de façon asynchrone. |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>) |
Créez un masque à partir des deux séquences passées pour être utilisées dans une tâche de classification de paire de séquences. Un masque de paire de séquence BERT a le format suivant : 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 | première séquence | deuxième séquence | Si |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Tokenizer pour le modèle Bert. |
| Decode(IEnumerable<Int32>, Boolean) |
Décodez les ID donnés, revenez à une chaîne. (Hérité de WordPieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>) |
Décodez les ID donnés, revenez à une chaîne. (Hérité de WordPieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(String, Boolean, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(String, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de WordPieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de WordPieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de WordPieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean) |
Récupérer le masque des jetons de séquence à partir d’une liste d’ID. |
| GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean) |
Récupérer le masque des jetons de séquence à partir d’une liste d’ID. |