語言

BpeTokenizer.CreateAsync 方法

定義

非同步建立一個新的 Bpe 分詞器物件,用於文字編碼。

public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)

參數

vocabStream
Stream

包含字串鍵及其 ID 字典的 JSON 串流。

mergesStream
Stream

包含代幣對列表的串流。

preTokenizer
PreTokenizer

使用前分詞器。

normalizer
Normalizer

正常化劑。

specialTokens
IReadOnlyDictionary<String,Int32>

字典將特殊標記映射到 Ids。

unknownToken
String

模型使用的未知標記。

continuingSubwordPrefix
String

前綴用來附加在不代表詞首的子詞單元上。

endOfWordSuffix
String

後綴用於附加於代表詞尾的子詞單位。

fuseUnknownTokens
Boolean

說明是否允許多個未知標記被融合。

傳回

備註

建立分詞器時,請確保詞彙串流來源為可信賴的提供者。

適用於