Langue

CodeGenTokenizer Classe

Définition

Représente le modèle d’encodage de paire d’octets. Implémenter le tokenizer CodeGen décrit dans https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
Héritage
CodeGenTokenizer
Dérivé

Propriétés

Nom Description
AddBeginningOfSentence

Obtient l’indicateur indiquant s’il faut inclure le début du jeton de phrase dans l’encodage.

AddEndOfSentence

Obtient l’indicateur indiquant s’il faut inclure la fin du jeton de phrase dans l’encodage.

AddPrefixSpace

Obtient l’indicateur indiquant s’il faut inclure un espace de début avant d’encoder le texte.

BeginningOfSentenceId

Obtient la fin de l’ID du jeton de phrase.

BeginningOfSentenceToken

Obtient le début du jeton de phrase.

EndOfSentenceId

Obtient la fin de l’ID du jeton de phrase.

EndOfSentenceToken

Obtient la fin du jeton de phrase.

Normalizer

Obtient le normaliseur en cours d’utilisation par le tokenizer.

PreTokenizer

Obtient le PreTokenizer utilisé par le tokenizer.

SpecialTokens

Obtient les jetons ajoutés.

UnknownToken

Jeton inconnu.

UnknownTokenId

Obtient l’ID de jeton inconnu.

Vocabulary

Obtient les jetons de mappage de dictionnaire en ID.

Méthodes

Nom Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

(Hérité de Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

CountTokens(String, Boolean, Boolean)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

(Hérité de Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenez le nombre de jetons auxquels le texte d’entrée sera encodé.

Create(Stream, Stream, Boolean, Boolean, Boolean)

Créez un tokenizer CodeGen à partir des flux vocaux donnés et fusionnez.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Décodez les ID donnés, revenez à une chaîne.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Décodez les ID donnés en texte et stockez le résultat dans l’étendue destination .

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Décodez les ID donnés en texte et stockez le résultat dans l’étendue destination .

Decode(IEnumerable<Int32>)

Décodez les ID donnés, revenez à une chaîne.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Encode le texte d’entrée dans les ID de jetons.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

(Hérité de Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jetons jusqu’au nombre maximal de jetons.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons.

(Hérité de Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Encode le texte d’entrée dans les ID de jetons.

EncodeToIds(String, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton.

(Hérité de Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jetons jusqu’au nombre maximal de jetons.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Encode le texte d’entrée vers les ID de jeton jusqu’au nombre maximal de jetons.

<param name="text">The text to encode.</param> (Hérité de Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Encode le texte d’entrée vers les ID de jeton.

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Encode le texte d’entrée à l’objet a la liste des jetons, les ID de jetons, le mappage de décalage de jetons.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Encode le texte d’entrée dans une liste de EncodedTokens.

(Hérité de Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Encode le texte d’entrée à l’objet a la liste des jetons, les ID de jetons, le mappage de décalage de jetons.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Encode le texte d’entrée dans une liste de EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Encode le texte d’entrée dans une liste de EncodedTokens.

(Hérité de Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale à partir du début dans le texte sans dépasser la limite de jetons.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale de la fin dans le texte sans dépasser la limite de jeton.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Recherchez l’index de la capacité d’encodage maximale sans dépasser la limite de jetons.

(Hérité de Tokenizer)

S’applique à