LlamaTokenizer.Create Méthode
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Créez à partir du flux de modèle donné un LlamaTokenizer basé sur SentencePieceTokenizer. Le flux de modèle doit contenir le modèle PhrasePiece Bpe en fonction de la https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto spécification.
public static Microsoft.ML.Tokenizers.LlamaTokenizer Create(System.IO.Stream modelStream, bool addBeginOfSentence = true, bool addEndOfSentence = false, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default);
static member Create : System.IO.Stream * bool * bool * System.Collections.Generic.IReadOnlyDictionary<string, int> -> Microsoft.ML.Tokenizers.LlamaTokenizer
Public Shared Function Create (modelStream As Stream, Optional addBeginOfSentence As Boolean = true, Optional addEndOfSentence As Boolean = false, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing) As LlamaTokenizer
Paramètres
- modelStream
- Stream
Flux contenant le modèle PhrasePiece Bpe.
- addBeginOfSentence
- Boolean
Indiquez l’émission du début du jeton de phrase pendant l’encodage.
- addEndOfSentence
- Boolean
Indiquez l’émission du jeton de fin de phrase pendant l’encodage.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Jetons supplémentaires à ajouter au vocabulaire.
Retours
Remarques
Lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.