語言

BpeTokenizer.Create 方法

定義

多載

名稱 Description
Create(Stream, Stream)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(String, String)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(Stream, Stream)

來源:
BPETokenizer.cs
來源:
BPETokenizer.cs
來源:
BPETokenizer.cs

建立一個新的 Bpe 分子器物件來進行文字編碼。

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

參數

vocabStream
Stream

包含字串鍵及其 ID 字典的 JSON 串流。

mergesStream
Stream

包含代幣對列表的串流。

傳回

備註

建立分詞器時,請確保詞彙串流來源為可信賴的提供者。

適用於

Create(String, String)

來源:
BPETokenizer.cs
來源:
BPETokenizer.cs
來源:
BPETokenizer.cs

建立一個新的 Bpe 分子器物件來進行文字編碼。

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

參數

vocabFile
String

包含字串鍵及其 ID 字典的 JSON 檔案路徑。

mergesFile
String

包含標記對清單的檔案路徑。

傳回

備註

建立分詞器時,請確保詞彙檔案來源為可信提供者。

適用於

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

來源:
BPETokenizer.cs
來源:
BPETokenizer.cs
來源:
BPETokenizer.cs

建立一個新的 Bpe 分子器物件來進行文字編碼。

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

參數

vocabStream
Stream

包含字串鍵及其 ID 字典的 JSON 串流。

mergesStream
Stream

包含代幣對列表的串流。

preTokenizer
PreTokenizer

使用前分詞器。

normalizer
Normalizer

正常化劑。

specialTokens
IReadOnlyDictionary<String,Int32>

字典將特殊標記映射到 Ids。

unknownToken
String

模型使用的未知標記。

continuingSubwordPrefix
String

前綴用來附加在不代表詞首的子詞單元上。

endOfWordSuffix
String

後綴用於附加於代表詞尾的子詞單位。

fuseUnknownTokens
Boolean

說明是否允許多個未知標記被融合。

傳回

備註

建立分詞器時,請確保詞彙串流來源為可信賴的提供者。

適用於

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

來源:
BPETokenizer.cs
來源:
BPETokenizer.cs
來源:
BPETokenizer.cs

建立一個新的 Bpe 分子器物件來進行文字編碼。

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

參數

vocabFile
String

包含字串鍵及其 ID 字典的 JSON 檔案路徑。

mergesFile
String

包含標記對清單的檔案路徑。

preTokenizer
PreTokenizer

使用前分詞器。

normalizer
Normalizer

正常化劑。

specialTokens
IReadOnlyDictionary<String,Int32>

字典將特殊標記映射到 Ids。

unknownToken
String

模型使用的未知標記。

continuingSubwordPrefix
String

前綴用來附加在不代表詞首的子詞單元上。

endOfWordSuffix
String

後綴用於附加於代表詞尾的子詞單位。

fuseUnknownTokens
Boolean

說明是否允許多個未知標記被融合。

傳回

備註

建立分詞器時,請確保詞彙檔案來源為可信提供者。

適用於