Langue

BpeTokenizer.Create Méthode

Définition

Surcharges

Nom Description
Create(Stream, Stream)

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

Create(String, String)

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

Create(Stream, Stream)

Source:
BPETokenizer.cs
Source:
BPETokenizer.cs
Source:
BPETokenizer.cs

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

Paramètres

vocabStream
Stream

Flux JSON contenant le dictionnaire de clés de chaîne et leurs ID.

mergesStream
Stream

Flux contenant la liste des paires de jetons.

Retours

Remarques

Lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.

S’applique à

Create(String, String)

Source:
BPETokenizer.cs
Source:
BPETokenizer.cs
Source:
BPETokenizer.cs

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

Paramètres

vocabFile
String

Chemin d’accès au fichier JSON contenant le dictionnaire de clés de chaîne et leurs ID.

mergesFile
String

Chemin d’accès du fichier contenant la liste des paires de jetons.

Retours

Remarques

Lors de la création du générateur de jetons, vérifiez que le fichier de vocabulaire est source d’un fournisseur approuvé.

S’applique à

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Source:
BPETokenizer.cs
Source:
BPETokenizer.cs
Source:
BPETokenizer.cs

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Paramètres

vocabStream
Stream

Flux JSON contenant le dictionnaire de clés de chaîne et leurs ID.

mergesStream
Stream

Flux contenant la liste des paires de jetons.

preTokenizer
PreTokenizer

Pré-tokenizer à utiliser.

normalizer
Normalizer

Normaliseur à utiliser.

specialTokens
IReadOnlyDictionary<String,Int32>

Le dictionnaire mappant des jetons spéciaux aux ID.

unknownToken
String

Jeton inconnu à utiliser par le modèle.

continuingSubwordPrefix
String

Préfixe à attacher à des unités de sous-mots qui ne représentent pas un début de mot.

endOfWordSuffix
String

Suffixe à attacher à des unités de sous-mots qui représentent une fin de mot.

fuseUnknownTokens
Boolean

Indiquez si l’autorisation de plusieurs jetons inconnus est fusionnée.

Retours

Remarques

Lors de la création du tokenizer, vérifiez que le flux de vocabulaire est source d’un fournisseur approuvé.

S’applique à

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Source:
BPETokenizer.cs
Source:
BPETokenizer.cs
Source:
BPETokenizer.cs

Créez un objet de tokenizer Bpe à utiliser pour l’encodage de texte.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Paramètres

vocabFile
String

Chemin d’accès au fichier JSON contenant le dictionnaire de clés de chaîne et leurs ID.

mergesFile
String

Chemin d’accès du fichier contenant la liste des paires de jetons.

preTokenizer
PreTokenizer

Pré-tokenizer à utiliser.

normalizer
Normalizer

Normaliseur à utiliser.

specialTokens
IReadOnlyDictionary<String,Int32>

Le dictionnaire mappant des jetons spéciaux aux ID.

unknownToken
String

Jeton inconnu à utiliser par le modèle.

continuingSubwordPrefix
String

Préfixe à attacher à des unités de sous-mots qui ne représentent pas un début de mot.

endOfWordSuffix
String

Suffixe à attacher à des unités de sous-mots qui représentent une fin de mot.

fuseUnknownTokens
Boolean

Indiquez si l’autorisation de plusieurs jetons inconnus est fusionnée.

Retours

Remarques

Lors de la création du générateur de jetons, vérifiez que le fichier de vocabulaire est source d’un fournisseur approuvé.

S’applique à