Język

CodeGenTokenizer.Create(Stream, Stream, Boolean, Boolean, Boolean) Metoda

Definicja

Utwórz tokenizator CodeGen na podstawie danego wywołania i scala strumienie.

public static Microsoft.ML.Tokenizers.CodeGenTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream mergesStream, bool addPrefixSpace = false, bool addBeginOfSentence = false, bool addEndOfSentence = false);
static member Create : System.IO.Stream * System.IO.Stream * bool * bool * bool -> Microsoft.ML.Tokenizers.CodeGenTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional addPrefixSpace As Boolean = false, Optional addBeginOfSentence As Boolean = false, Optional addEndOfSentence As Boolean = false) As CodeGenTokenizer

Parametry

vocabStream
Stream

Strumień zawierający plik vocab.

mergesStream
Stream

Strumień zawierający plik scalania.

addPrefixSpace
Boolean

Określ, czy należy dodać spację przed tokenem.

addBeginOfSentence
Boolean

Wskazuje emitowanie początku tokenu zdania podczas kodowania.

addEndOfSentence
Boolean

Wskazuje emitowanie końca tokenu zdania podczas kodowania.

Zwraca

Obiekt tokenizer CodeGen.

Uwagi

Tokenizer zostanie utworzony zgodnie z konfiguracją określoną w https://huggingface.co/Salesforce/codegen-350M-mono/raw/main/tokenizer.json. Ważne jest, aby zapewnić podobne wywołanie i scala pliki z plikami używanymi w trenowaniu modelu. Wywołanie i scalanie plików można pobrać z następujących linków: https://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/vocab.json?download=truehttps://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/merges.txt?download=true Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa pochodzi od zaufanego dostawcy.

Dotyczy