BpeTokenizer.Create 方法
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
多載
| 名稱 | Description |
|---|---|
| Create(Stream, Stream) |
建立一個新的 Bpe 分子器物件來進行文字編碼。 |
| Create(String, String) |
建立一個新的 Bpe 分子器物件來進行文字編碼。 |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
建立一個新的 Bpe 分子器物件來進行文字編碼。 |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
建立一個新的 Bpe 分子器物件來進行文字編碼。 |
Create(Stream, Stream)
建立一個新的 Bpe 分子器物件來進行文字編碼。
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer
參數
- vocabStream
- Stream
包含字串鍵及其 ID 字典的 JSON 串流。
- mergesStream
- Stream
包含代幣對列表的串流。
傳回
備註
建立分詞器時,請確保詞彙串流來源為可信賴的提供者。
適用於
Create(String, String)
建立一個新的 Bpe 分子器物件來進行文字編碼。
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer
參數
- vocabFile
- String
包含字串鍵及其 ID 字典的 JSON 檔案路徑。
- mergesFile
- String
包含標記對清單的檔案路徑。
傳回
備註
建立分詞器時,請確保詞彙檔案來源為可信提供者。
適用於
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
建立一個新的 Bpe 分子器物件來進行文字編碼。
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
參數
- vocabStream
- Stream
包含字串鍵及其 ID 字典的 JSON 串流。
- mergesStream
- Stream
包含代幣對列表的串流。
- preTokenizer
- PreTokenizer
使用前分詞器。
- normalizer
- Normalizer
正常化劑。
- specialTokens
- IReadOnlyDictionary<String,Int32>
字典將特殊標記映射到 Ids。
- unknownToken
- String
模型使用的未知標記。
- continuingSubwordPrefix
- String
前綴用來附加在不代表詞首的子詞單元上。
- endOfWordSuffix
- String
後綴用於附加於代表詞尾的子詞單位。
- fuseUnknownTokens
- Boolean
說明是否允許多個未知標記被融合。
傳回
備註
建立分詞器時,請確保詞彙串流來源為可信賴的提供者。
適用於
Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
建立一個新的 Bpe 分子器物件來進行文字編碼。
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
參數
- vocabFile
- String
包含字串鍵及其 ID 字典的 JSON 檔案路徑。
- mergesFile
- String
包含標記對清單的檔案路徑。
- preTokenizer
- PreTokenizer
使用前分詞器。
- normalizer
- Normalizer
正常化劑。
- specialTokens
- IReadOnlyDictionary<String,Int32>
字典將特殊標記映射到 Ids。
- unknownToken
- String
模型使用的未知標記。
- continuingSubwordPrefix
- String
前綴用來附加在不代表詞首的子詞單元上。
- endOfWordSuffix
- String
後綴用於附加於代表詞尾的子詞單位。
- fuseUnknownTokens
- Boolean
說明是否允許多個未知標記被融合。
傳回
備註
建立分詞器時,請確保詞彙檔案來源為可信提供者。