LlamaTokenizer.Create Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Utwórz na podstawie danego strumienia modelu llamaTokenizer, który jest oparty na funkcji SentencePieceTokenizer. Strumień modelu powinien zawierać model SentencePiece Bpe zgodnie ze https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto specyfikacją.
public static Microsoft.ML.Tokenizers.LlamaTokenizer Create(System.IO.Stream modelStream, bool addBeginOfSentence = true, bool addEndOfSentence = false, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default);
static member Create : System.IO.Stream * bool * bool * System.Collections.Generic.IReadOnlyDictionary<string, int> -> Microsoft.ML.Tokenizers.LlamaTokenizer
Public Shared Function Create (modelStream As Stream, Optional addBeginOfSentence As Boolean = true, Optional addEndOfSentence As Boolean = false, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing) As LlamaTokenizer
Parametry
- modelStream
- Stream
Strumień zawierający model SentencePiece Bpe.
- addBeginOfSentence
- Boolean
Wskazuje emitowanie początku tokenu zdania podczas kodowania.
- addEndOfSentence
- Boolean
Wskazuje emitowanie końca tokenu zdania podczas kodowania.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Dodatkowe tokeny do dodania do słownictwa.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.