LlamaTokenizer Classe
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
LlamaTokenizer est SentencePieceTokenizer qui est implémenté sur la https://github.com/google/sentencepiecebase .
public sealed class LlamaTokenizer : Microsoft.ML.Tokenizers.SentencePieceTokenizer
type LlamaTokenizer = class
inherit SentencePieceTokenizer
Public NotInheritable Class LlamaTokenizer
Inherits SentencePieceTokenizer
- Héritage
Propriétés
| Nom | Description |
|---|---|
| AddBeginningOfSentence |
Indiquez l’émission du début du jeton de phrase pendant l’encodage. (Hérité de SentencePieceTokenizer) |
| AddDummyPrefix |
Indiquez l’émission du caractère de préfixe U+2581 au début du jeton de phrase pendant la normalisation et l’encodage. (Hérité de SentencePieceTokenizer) |
| AddEndOfSentence |
Indiquez l’émission du jeton de fin de phrase pendant l’encodage. (Hérité de SentencePieceTokenizer) |
| BeginningOfSentenceId |
ID du début du jeton de phrase. (Hérité de SentencePieceTokenizer) |
| BeginningOfSentenceToken |
Début du jeton de phrase. (Hérité de SentencePieceTokenizer) |
| ByteFallback |
Spécifie si le modèle effectue une secours d’octets lorsqu’il rencontre des jetons inconnus pendant le processus d’encodage. (Hérité de SentencePieceTokenizer) |
| EndOfSentenceId |
ID de la fin du jeton de phrase. (Hérité de SentencePieceTokenizer) |
| EndOfSentenceToken |
Fin du jeton de phrase. (Hérité de SentencePieceTokenizer) |
| EscapeWhiteSpaces |
Indiquez si les espaces doivent être remplacés par le caractère U+2581 pendant la normalisation et l’encodage. (Hérité de SentencePieceTokenizer) |
| Normalizer |
Obtient le normaliseur en cours d’utilisation par le tokenizer. (Hérité de SentencePieceTokenizer) |
| PreTokenizer |
Obtient le PreTokenizer utilisé par le tokenizer. (Hérité de SentencePieceTokenizer) |
| SpecialTokens |
Jetons spéciaux. (Hérité de SentencePieceTokenizer) |
| TreatWhitespaceAsSuffix |
Indiquez l’émission du caractère U+2581 à la fin du dernier jeton de phrase au lieu du début du jeton de phrase pendant la normalisation et l’encodage. (Hérité de SentencePieceTokenizer) |
| UnknownId |
ID du jeton inconnu. (Hérité de SentencePieceTokenizer) |
| UnknownToken |
Jeton inconnu. (Hérité de SentencePieceTokenizer) |
| Vocabulary |
Vocabulaire du modèle. (Hérité de SentencePieceTokenizer) |
Méthodes
| Nom | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de SentencePieceTokenizer) |
| Create(Stream, Boolean, Boolean, IReadOnlyDictionary<String,Int32>) |
Créez à partir du flux de modèle donné un LlamaTokenizer basé sur SentencePieceTokenizer. Le flux de modèle doit contenir le modèle PhrasePiece Bpe en fonction de la https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto spécification. |
| Decode(IEnumerable<Int32>, Boolean) |
Décodez les ID donnés, revenez à une chaîne. (Hérité de SentencePieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>) |
Décodez les ID donnés, revenez à une chaîne. (Hérité de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. (Hérité de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. (Hérité de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. (Hérité de SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. <param name="text">The text to encode.</param> (Hérité de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée une liste de EncodedTokens avec la valeur de chaîne du jeton, de l’ID et du décalage. (Hérité de SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée une liste de EncodedTokens avec la valeur de chaîne du jeton, de l’ID et du décalage. (Hérité de SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons. (Hérité de SentencePieceTokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons. (Hérité de SentencePieceTokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Boolean, Boolean, Int32, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton. (Hérité de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Boolean, Boolean, Int32, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton. (Hérité de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |