Język

BpeTokenizer.Create Metoda

Definicja

Przeciążenia

Nazwa Opis
Create(Stream, Stream)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(String, String)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(Stream, Stream)

Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

Parametry

vocabStream
Stream

Strumień JSON zawierający słownik kluczy ciągów i ich identyfikatory.

mergesStream
Stream

Strumień zawierający listę par tokenów.

Zwraca

Uwagi

Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.

Dotyczy

Create(String, String)

Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

Parametry

vocabFile
String

Ścieżka pliku JSON zawierająca słownik kluczy ciągów i ich identyfikatory.

mergesFile
String

Ścieżka pliku zawierająca listę par tokenów.

Zwraca

Uwagi

Podczas tworzenia tokenizatora upewnij się, że plik słownictwa pochodzi od zaufanego dostawcy.

Dotyczy

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parametry

vocabStream
Stream

Strumień JSON zawierający słownik kluczy ciągów i ich identyfikatory.

mergesStream
Stream

Strumień zawierający listę par tokenów.

preTokenizer
PreTokenizer

Pre-tokenizer do użycia.

normalizer
Normalizer

Normalizator do użycia.

specialTokens
IReadOnlyDictionary<String,Int32>

Słownik mapuje specjalne tokeny na identyfikatory.

unknownToken
String

Nieznany token, który ma być używany przez model.

continuingSubwordPrefix
String

Prefiks do dołączania do jednostek wyrazów podrzędnych, które nie reprezentują początku wyrazu.

endOfWordSuffix
String

Sufiks dołączany do jednostek wyrazów podrzędnych reprezentujących koniec wyrazu.

fuseUnknownTokens
Boolean

Wskazuje, czy zezwalanie na łączenie wielu nieznanych tokenów.

Zwraca

Uwagi

Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.

Dotyczy

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs
Źródło:
BPETokenizer.cs

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parametry

vocabFile
String

Ścieżka pliku JSON zawierająca słownik kluczy ciągów i ich identyfikatory.

mergesFile
String

Ścieżka pliku zawierająca listę par tokenów.

preTokenizer
PreTokenizer

Pre-tokenizer do użycia.

normalizer
Normalizer

Normalizator do użycia.

specialTokens
IReadOnlyDictionary<String,Int32>

Słownik mapuje specjalne tokeny na identyfikatory.

unknownToken
String

Nieznany token, który ma być używany przez model.

continuingSubwordPrefix
String

Prefiks do dołączania do jednostek wyrazów podrzędnych, które nie reprezentują początku wyrazu.

endOfWordSuffix
String

Sufiks dołączany do jednostek wyrazów podrzędnych reprezentujących koniec wyrazu.

fuseUnknownTokens
Boolean

Wskazuje, czy zezwalanie na łączenie wielu nieznanych tokenów.

Zwraca

Uwagi

Podczas tworzenia tokenizatora upewnij się, że plik słownictwa pochodzi od zaufanego dostawcy.

Dotyczy