Langue

BertTokenizer Classe

Définition

Tokenizer pour le modèle Bert.

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
Héritage

Remarques

Le BertTokenizer est basé sur le WordPieceTokenizer et est utilisé pour tokeniser du texte pour les modèles Bert. L’implémentation de BertTokenizer est basée sur l’implémentation initiale de Bert dans la bibliothèque Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

Propriétés

Nom Description
ApplyBasicTokenization

Obtient une valeur indiquant si le tokenizer doit effectuer une tokenisation de base. Comme le texte propre, normalisez-le, réduisez-le, etc.

ClassificationToken

Obtient le jeton de classifieur qui est utilisé lors de la classification de séquence (classification de l’ensemble de la séquence au lieu de la classification par jeton). Il s’agit du premier jeton de la séquence lorsqu’elle est générée avec des jetons spéciaux.

ClassificationTokenId

Obtient l’ID de jeton de classifieur

ContinuingSubwordPrefix

Obtient le préfixe à utiliser pour les sous-mots qui ne sont pas la première partie d’un mot.

(Hérité de WordPieceTokenizer)
IndividuallyTokenizeCjk

Obtient une valeur indiquant si le tokenizer doit fractionner les caractères CJK en jetons.

LowerCaseBeforeTokenization

Obtient une valeur indiquant si le tokenizer doit minusculer le texte d’entrée.

MaskingToken

Obtient le jeton de masque utilisé pour masquer les valeurs. Il s’agit du jeton utilisé lors de l’apprentissage de ce modèle avec la modélisation du langage masqué. Il s’agit du jeton que le modèle tentera de prédire.

MaskingTokenId

Obtient l’ID du jeton de masque

MaxInputCharsPerWord

Obtient le nombre maximal de caractères à autoriser dans un mot unique.

(Hérité de WordPieceTokenizer)
Normalizer

Obtient le normaliseur en cours d’utilisation par le tokenizer.

(Hérité de WordPieceTokenizer)
PaddingToken

Obtient le jeton utilisé pour le remplissage, par exemple lors du traitement par lots de séquences de longueurs différentes

PaddingTokenId

Obtient l’ID du jeton de remplissage

PreTokenizer

Obtient le PreTokenizer utilisé par le tokenizer.

(Hérité de WordPieceTokenizer)
RemoveNonSpacingMarks

Obtient une valeur indiquant s’il faut supprimer des marques d’interligne.

SeparatorToken

Obtient le jeton de séparation, qui est utilisé lors de la génération d’une séquence à partir de plusieurs séquences, par exemple deux séquences pour la classification de séquences ou pour un texte et une question pour répondre aux questions. Il est également utilisé comme dernier jeton d’une séquence créée avec des jetons spéciaux.

SeparatorTokenId

Obtient l’ID du jeton de séparation

SpecialTokens

Obtient les jetons spéciaux et leurs ID correspondants.

(Hérité de WordPieceTokenizer)
SplitOnSpecialTokens

Obtient une valeur indiquant si le tokenizer doit être fractionné sur les jetons spéciaux ou traiter des jetons spéciaux comme du texte normal.

UnknownToken

Obtient le jeton inconnu. Un jeton qui n’est pas dans le vocabulaire ne peut pas être converti en ID et est défini comme ce jeton à la place.

(Hérité de WordPieceTokenizer)
UnknownTokenId

Obtient l’ID de jeton inconnu. Un jeton qui n’est pas dans le vocabulaire ne peut pas être converti en ID et est défini comme ce jeton à la place.

(Hérité de WordPieceTokenizer)

Méthodes

Nom Description
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

Générez des entrées de modèle à partir d’une séquence ou d’une paire de séquences pour les tâches de classification de séquence en concaténant et en ajoutant des jetons spéciaux. Une séquence BERT a le format suivant : - séquence unique : [CLS] tokenIds [SEP] - paire de séquences : [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Générez des entrées de modèle à partir d’une séquence ou d’une paire de séquences pour les tâches de classification de séquence en concaténant et en ajoutant des jetons spéciaux. Une séquence BERT a le format suivant : - séquence unique : [CLS] tokenIds [SEP] - paire de séquences : [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

(Hérité de Tokenizer)
CountTokens(String, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

(Hérité de Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

(Hérité de WordPieceTokenizer)
Create(Stream, BertOptions)

Créez une instance de la classe BertTokenizer.

Create(String, BertOptions)

Créez une instance de la classe BertTokenizer.

CreateAsync(Stream, BertOptions, CancellationToken)

Créez une instance de la BertTokenizer classe de façon asynchrone.

CreateAsync(String, BertOptions, CancellationToken)

Créez une instance de la BertTokenizer classe de façon asynchrone.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

Créez un masque à partir des deux séquences passées pour être utilisées dans une tâche de classification de paire de séquences. Un masque de paire de séquence BERT a le format suivant : 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 | première séquence | deuxième séquence | Si additionalTokenIds elle a la valeur Null, cette méthode retourne uniquement la première partie des ID de type (0s).

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Tokenizer pour le modèle Bert.

Decode(IEnumerable<Int32>, Boolean)

Décodez les ID donnés, revenez à une chaîne.

(Hérité de WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Décodez les ID donnés en texte et stockez le résultat dans l’étendue destination .

(Hérité de WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Décodez les ID donnés en texte et stockez le résultat dans l’étendue destination .

(Hérité de WordPieceTokenizer)
Decode(IEnumerable<Int32>)

Décodez les ID donnés, revenez à une chaîne.

(Hérité de WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(String, Boolean, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(String, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Encode le texte d’entrée vers les ID de jeton.

(Hérité de WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Encode le texte d’entrée dans une liste de EncodedTokens.

(Hérité de Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Encode le texte d’entrée dans une liste de EncodedTokens.

(Hérité de WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Encode le texte d’entrée dans une liste de EncodedTokens.

(Hérité de Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

Récupérer le masque des jetons de séquence à partir d’une liste d’ID.

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

Récupérer le masque des jetons de séquence à partir d’une liste d’ID.

S’applique à