BpeTokenizer Classe
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Représente le modèle d’encodage de paire d’octets.
public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
- Héritage
Propriétés
| Nom | Description |
|---|---|
| ContinuingSubwordPrefix |
Préfixe à utiliser pour chaque sous-mot qui n’est pas un début de mot |
| EndOfWordSuffix |
Suffixe facultatif pour caractériser et sous-mot de fin de mot |
| FuseUnknownTokens |
Obtient ou définit si l’autorisation de plusieurs jetons inconnus est fusionnée |
| Normalizer |
Obtient le normaliseur en cours d’utilisation par le tokenizer. |
| PreTokenizer |
Obtient le PreTokenizer utilisé par le tokenizer. |
| SpecialTokens |
Obtient les jetons spéciaux. |
| UnknownToken |
Obtient ou définit un jeton inconnu. Jeton inconnu à utiliser lorsque nous rencontrons un caractère inconnu |
| Vocabulary |
Obtient les jetons de mappage de dictionnaire en ID. |
Méthodes
| Nom | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(Stream, Stream) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(String, String) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Créez un objet de tokenizer Bpe de manière asynchrone à utiliser pour l’encodage de texte. |
| Decode(IEnumerable<Int32>, Boolean) |
Décodez les ID donnés, revenez à une chaîne. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>) |
Décodez les ID donnés, revenez à une chaîne. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. (Hérité de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. <param name="text">The text to encode.</Param> (Hérité de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |