語言

BertTokenizer 類別

定義

Bert 模型的分詞器。

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
繼承

備註

BertTokenizer 是基於 WordPieceTokenizer,用於為 Bert 模型進行文字分詞。 BertTokenizer 的實作基於 Hugging Face Transformers 函式庫中的原始 Bert 實作。 https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

屬性

名稱 Description
ApplyBasicTokenization

會得到一個值,指示分詞器是否應該進行基本分詞。 像是乾淨的文字、正規化、縮小大寫等等。

ClassificationToken

取得分類器標記,用於序列分類(整個序列分類,而非逐標記分類)。 當用特殊標記堆疊時,它是序列中的第一個標記。

ClassificationTokenId

取得分類器標記 Id

ContinuingSubwordPrefix

取得用於非詞首部分的子詞的前綴。

(繼承來源 WordPieceTokenizer)
IndividuallyTokenizeCjk

會得到一個值,指示分詞器是否應該將日韓漢字拆分成符號。

LowerCaseBeforeTokenization

會得到一個值,指示分詞器是否應該將輸入文字縮小。

MaskingToken

取得用於遮罩值的遮罩標記。 這是用遮罩語言建模訓練模型時所使用的標記。 這就是模型會嘗試預測的標記。

MaskingTokenId

取得面具令牌 ID

MaxInputCharsPerWord

在一個字中獲得最多可授權字元數。

(繼承來源 WordPieceTokenizer)
Normalizer

讓 Tokenizer 使用正規化器。

(繼承來源 WordPieceTokenizer)
PaddingToken

取得用於填充的標記,例如批次處理不同長度序列時

PaddingTokenId

取得填充標記 ID

PreTokenizer

取得分幣器使用的預分組器。

(繼承來源 WordPieceTokenizer)
RemoveNonSpacingMarks

會有一個值指示是否要移除非間距標記。

SeparatorToken

取得分隔符標記,用於從多個序列組成序列,例如兩個序列用於序列分類,或文本與問題用於問答。 它也被用作一個由特殊標記組成序列的最後一個標記。

SeparatorTokenId

取得分隔符 Id

SpecialTokens

取得特殊代幣及其對應的ID。

(繼承來源 WordPieceTokenizer)
SplitOnSpecialTokens

會獲得一個值,指示分詞器是否應該對特殊標記進行拆分,或將特殊標記視為一般文字。

UnknownToken

拿到未知標記。 詞彙表中不存在的標記無法轉換成 ID,並被設定為該標記。

(繼承來源 WordPieceTokenizer)
UnknownTokenId

取得未知的令牌 ID。 詞彙表中不存在的標記無法轉換成 ID,並被設定為該標記。

(繼承來源 WordPieceTokenizer)

方法

名稱 Description
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

透過串接並加入特殊標記,從序列或序列對建立模型輸入,用於序列分類任務。 BERT 序列格式如下:- 單一序列: [CLS] tokenIds [SEP] - 一對序列: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

透過串接並加入特殊標記,從序列或序列對建立模型輸入,用於序列分類任務。 BERT 序列格式如下:- 單一序列: [CLS] tokenIds [SEP] - 一對序列: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

(繼承來源 WordPieceTokenizer)
Create(Stream, BertOptions)

建立一個新的類別實例 BertTokenizer 。

Create(String, BertOptions)

建立一個新的類別實例 BertTokenizer 。

CreateAsync(Stream, BertOptions, CancellationToken)

非同步建立一個新的類別實例 BertTokenizer 。

CreateAsync(String, BertOptions, CancellationToken)

非同步建立一個新的類別實例 BertTokenizer 。

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

從傳遞的兩個序列中建立一個遮罩,用於序列對分類任務。 BERT 序列對遮罩格式為:0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 1 1 1 1 1 |第一序列 |第二序列 |若 additionalTokenIds 為空,此方法僅回傳類型 ids 的第一部分(0)。

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Bert 模型的分詞器。

Decode(IEnumerable<Int32>, Boolean)

將給定的 id 解碼回字串。

(繼承來源 WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

(繼承來源 WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

(繼承來源 WordPieceTokenizer)
Decode(IEnumerable<Int32>)

將給定的 id 解碼回字串。

(繼承來源 WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, Boolean, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為標記 ID。

(繼承來源 WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

從 ID 清單中擷取序列標記的遮罩。

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

從 ID 清單中擷取序列標記的遮罩。

適用於