Langue

CodeGenTokenizer.Create(Stream, Stream, Boolean, Boolean, Boolean) Méthode

Définition

Créez un tokenizer CodeGen à partir des flux vocaux donnés et fusionnez.

public static Microsoft.ML.Tokenizers.CodeGenTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream mergesStream, bool addPrefixSpace = false, bool addBeginOfSentence = false, bool addEndOfSentence = false);
static member Create : System.IO.Stream * System.IO.Stream * bool * bool * bool -> Microsoft.ML.Tokenizers.CodeGenTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional addPrefixSpace As Boolean = false, Optional addBeginOfSentence As Boolean = false, Optional addEndOfSentence As Boolean = false) As CodeGenTokenizer

Paramètres

vocabStream
Stream

Flux contenant le fichier vocaux.

mergesStream
Stream

Flux contenant le fichier de fusion.

addPrefixSpace
Boolean

Indiquez s’il faut ajouter un espace avant le jeton.

addBeginOfSentence
Boolean

Indiquez l’émission du début du jeton de phrase pendant l’encodage.

addEndOfSentence
Boolean

Indiquez l’émission du jeton de fin de phrase pendant l’encodage.

Retours

Objet tokenizer CodeGen.

Remarques

Le tokenizer sera créé en fonction de la configuration spécifiée dans https://huggingface.co/Salesforce/codegen-350M-mono/raw/main/tokenizer.json. Il est important de fournir les fichiers vocaux similaires et de fusionner les fichiers utilisés dans l’entraînement du modèle. Les fichiers vocaux et fusionnes peuvent être téléchargés à partir des liens suivants : https://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/vocab.json?download=truehttps://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/merges.txt?download=true lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.

S’applique à