BpeTokenizer.CreateAsync 方法
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
非同步建立一個新的 Bpe 分詞器物件,用於文字編碼。
public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)
參數
- vocabStream
- Stream
包含字串鍵及其 ID 字典的 JSON 串流。
- mergesStream
- Stream
包含代幣對列表的串流。
- preTokenizer
- PreTokenizer
使用前分詞器。
- normalizer
- Normalizer
正常化劑。
- specialTokens
- IReadOnlyDictionary<String,Int32>
字典將特殊標記映射到 Ids。
- unknownToken
- String
模型使用的未知標記。
- continuingSubwordPrefix
- String
前綴用來附加在不代表詞首的子詞單元上。
- endOfWordSuffix
- String
後綴用於附加於代表詞尾的子詞單位。
- fuseUnknownTokens
- Boolean
說明是否允許多個未知標記被融合。
傳回
備註
建立分詞器時,請確保詞彙串流來源為可信賴的提供者。