BpeTokenizer.Create Méthode
Définition
Important
Certaines informations portent sur la préversion du produit qui est susceptible d’être en grande partie modifiée avant sa publication. Microsoft exclut toute garantie, expresse ou implicite, concernant les informations fournies ici.
Surcharges
| Nom | Description |
|---|---|
| Create(Stream, Stream) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(String, String) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte. |
Create(Stream, Stream)
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer
Paramètres
- vocabStream
- Stream
Flux JSON contenant le dictionnaire de clés de chaîne et leurs ID.
- mergesStream
- Stream
Flux contenant la liste des paires de jetons.
Retours
Remarques
Lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.
S’applique à
Create(String, String)
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer
Paramètres
- vocabFile
- String
Chemin d’accès au fichier JSON contenant le dictionnaire de clés de chaîne et leurs ID.
- mergesFile
- String
Chemin d’accès du fichier contenant la liste des paires de jetons.
Retours
Remarques
Lors de la création du générateur de jetons, vérifiez que le fichier de vocabulaire est source d’un fournisseur approuvé.
S’applique à
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Paramètres
- vocabStream
- Stream
Flux JSON contenant le dictionnaire de clés de chaîne et leurs ID.
- mergesStream
- Stream
Flux contenant la liste des paires de jetons.
- preTokenizer
- PreTokenizer
Pré-tokenizer à utiliser.
- normalizer
- Normalizer
Normaliseur à utiliser.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Le dictionnaire mappant des jetons spéciaux aux ID.
- unknownToken
- String
Jeton inconnu à utiliser par le modèle.
- continuingSubwordPrefix
- String
Préfixe à attacher à des unités de sous-mots qui ne représentent pas un début de mot.
- endOfWordSuffix
- String
Suffixe à attacher à des unités de sous-mots qui représentent une fin de mot.
- fuseUnknownTokens
- Boolean
Indiquez si l’autorisation de plusieurs jetons inconnus est fusionnée.
Retours
Remarques
Lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.
S’applique à
Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
- Source:
- BPETokenizer.cs
Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Paramètres
- vocabFile
- String
Chemin d’accès au fichier JSON contenant le dictionnaire de clés de chaîne et leurs ID.
- mergesFile
- String
Chemin d’accès du fichier contenant la liste des paires de jetons.
- preTokenizer
- PreTokenizer
Pré-tokenizer à utiliser.
- normalizer
- Normalizer
Normaliseur à utiliser.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Le dictionnaire mappant des jetons spéciaux aux ID.
- unknownToken
- String
Jeton inconnu à utiliser par le modèle.
- continuingSubwordPrefix
- String
Préfixe à attacher à des unités de sous-mots qui ne représentent pas un début de mot.
- endOfWordSuffix
- String
Suffixe à attacher à des unités de sous-mots qui représentent une fin de mot.
- fuseUnknownTokens
- Boolean
Indiquez si l’autorisation de plusieurs jetons inconnus est fusionnée.
Retours
Remarques
Lors de la création du générateur de jetons, vérifiez que le fichier de vocabulaire est source d’un fournisseur approuvé.