BpeTokenizer.CreateAsync Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Utwórz nowy obiekt tokenizatora Bpe asynchronicznie do użycia na potrzeby kodowania tekstu.
public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)
Parametry
- vocabStream
- Stream
Strumień JSON zawierający słownik kluczy ciągów i ich identyfikatory.
- mergesStream
- Stream
Strumień zawierający listę par tokenów.
- preTokenizer
- PreTokenizer
Pre-tokenizer do użycia.
- normalizer
- Normalizer
Normalizator do użycia.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Słownik mapuje specjalne tokeny na identyfikatory.
- unknownToken
- String
Nieznany token, który ma być używany przez model.
- continuingSubwordPrefix
- String
Prefiks do dołączania do jednostek wyrazów podrzędnych, które nie reprezentują początku wyrazu.
- endOfWordSuffix
- String
Sufiks dołączany do jednostek wyrazów podrzędnych reprezentujących koniec wyrazu.
- fuseUnknownTokens
- Boolean
Wskazuje, czy zezwalanie na łączenie wielu nieznanych tokenów.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.