CodeGenTokenizer Classe
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer CodeGen décrit dans https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview
public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
- Héritage
- Dérivé
Propriétés
| Nom | Description |
|---|---|
| AddBeginningOfSentence |
Obtient l’indicateur indiquant s’il faut inclure le début du jeton de phrase dans l’encodage. |
| AddEndOfSentence |
Obtient l’indicateur indiquant s’il faut inclure la fin du jeton de phrase dans l’encodage. |
| AddPrefixSpace |
Obtient l’indicateur indiquant s’il faut inclure un espace de début avant d’encoder le texte. |
| BeginningOfSentenceId |
Obtient la fin de l’ID du jeton de phrase. |
| BeginningOfSentenceToken |
Obtient le début du jeton de phrase. |
| EndOfSentenceId |
Obtient la fin de l’ID du jeton de phrase. |
| EndOfSentenceToken |
Obtient la fin du jeton de phrase. |
| Normalizer |
Obtient le normaliseur en cours d’utilisation par le tokenizer. |
| PreTokenizer |
Obtient le PreTokenizer utilisé par le tokenizer. |
| SpecialTokens |
Obtient les jetons ajoutés. |
| UnknownToken |
Jeton inconnu. |
| UnknownTokenId |
Obtient l’ID de jeton inconnu. |
| Vocabulary |
Obtient les jetons de mappage de dictionnaire en ID. |
Méthodes
| Nom | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. |
| CountTokens(String, Boolean, Boolean) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. (Hérité de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé. |
| Create(Stream, Stream, Boolean, Boolean, Boolean) |
Créez un tokenizer CodeGen à partir des flux vocaux donnés et fusionnez. |
| Decode(IEnumerable<Int32>, Boolean, Boolean) |
Décodez les ID donnés, revenez à une chaîne. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Décodez les ID donnés en texte et stockez le résultat dans l’étendue |
| Decode(IEnumerable<Int32>) |
Décodez les ID donnés, revenez à une chaîne. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée dans les ID de jetons. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jetons jusqu’au nombre maximal de jetons. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. (Hérité de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Encode le texte d’entrée dans les ID de jetons. |
| EncodeToIds(String, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton. (Hérité de Tokenizer) |
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jetons jusqu’au nombre maximal de jetons. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons. <param name="text">The text to encode.</param> (Hérité de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée vers les ID de jeton. |
| EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Encode le texte d’entrée à l’objet a la liste des jetons, les ID de jetons, le mappage de décalage de jetons. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Encode le texte d’entrée à l’objet a la liste des jetons, les ID de jetons, le mappage de décalage de jetons. |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Encode le texte d’entrée dans une liste de EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Encode le texte d’entrée dans une liste de EncodedTokens. (Hérité de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons. |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton. |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons. (Hérité de Tokenizer) |