Microsoft.ML.Tokenizers 命名空間

類別

名稱 Description
BertOptions

Bert 分詞器的選項。

BertTokenizer

Bert 模型的分詞器。

BitVector
Bpe

表示位元組對編碼模型。

BpeDecoder

允許解碼原始 BPE,方法是將所有詞符連接起來,然後將用來識別詞尾的後綴換成空白

BpeTokenizer

表示位元組對編碼模型。

BpeTrainer

負責訓練 Bpe 模型的 Bpe 訓練師。

CodeGenTokenizer

表示位元組對編碼模型。 實作描述的 CodeGen 分詞器 https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

表示位元組對編碼模型。

EnglishRobertaTokenizer

表示位元組對編碼模型。

LlamaTokenizer

LlamaTokenizer 是基於 https://github.com/google/sentencepiece的 SentencePieceTokenizer 實作。

LowerCaseNormalizer

在用分詞器處理前,先將字串正規化為小寫形式。

Model

代表在代幣化過程中使用的模型(如 BPE、Word Piece 或 Unigram)。

Normalizer

在用分詞器處理前,先將字串正規化。

Phi2Tokenizer

表示位元組對編碼模型。 實作描述的 Phi2 分詞器 https://huggingface.co/microsoft/phi-2

PreTokenizer

所有前分詞器類別的基礎類別。 PreTokenizer 負責執行預分段步驟。

RegexPreTokenizer

Tiktoken 代幣化器的前設分子器。

RobertaPreTokenizer

Roberta English 分詞器的前分詞器。

SentencePieceNormalizer

依照 SentencePiece 正規化來正規化字串。

SentencePieceTokenizer

SentencePieceBpe 是一個分詞器,利用 SentencePiece Bpe 模型將輸入拆分成詞號。

Split

此分割包含底層的分割標記及其在原始字串中的偏移量。 這些偏移量位於 original 參照中。 它也包含與當前分割相關的任何內容 Token 。

TiktokenTokenizer

表示快速位元組對編碼分詞器。

Token

表示由分詞化過程中產生的標記,包含標記子字串、與標記子串相關的 id,以及與原始字串相關的偏移映射。

Tokenizer

提供分詞器抽象化,使文字能編碼成標記,並將標記 ID 解碼回文字。

TokenizerDecoder

解碼器負責將給定的標記清單合併成字串。

TokenizerResult

編碼代表分詞器的輸出。

Trainer

A Trainer 有責任訓練模型。 我們會用台詞/句子餵給它,然後它就能訓練給定 Model的 。

UpperCaseNormalizer

在用分詞器處理前,先將字串正規化為大寫。

WhiteSpace

前分詞器在詞界處分割文本。 這個單字是一組字母、數字和底線符號。

WordPieceOptions

WordPiece 代幣化器的選項。

WordPieceTokenizer

代表 WordPiece 分詞器。

結構

名稱 Description
AddedToken

代表使用者在現有模型詞彙上新增的一個標記。 AddedToken 可以設定在各種情況下指定它們應該有的行為,例如:

  • 是否應該只對應單字
  • 是否要在左側或右側加入任何空白區
EncodedToken

表示由分詞化過程中產生的標記,包含標記子字串、與標記子串相關的 id,以及與原始字串相關的偏移映射。

EncodeResults<T>

編碼文字的結果。

EncodeSettings

用於編碼文字的設定。

NormalizedString

包含正規化字串及對應至原始字串的資訊。

Progress

列舉

名稱 Description
ProgressState

代表報告進度的狀態。

委派

名稱 Description
ReportProgress