Microsoft.ML.Tokenizers 名前空間

クラス

名前 説明
BertOptions

Bert トークナイザーのオプション。

BertTokenizer

Bert モデルのトークナイザー。

BitVector
Bpe

バイト ペア エンコード モデルを表します。

BpeDecoder

すべてのトークンを結合し、単語の終わりを空白で識別するために使用されるサフィックスを置き換えることで、元の BPE をデコードできるようにします

BpeTokenizer

バイト ペア エンコード モデルを表します。

BpeTrainer

Bpe モデルのトレーニングを担当する Bpe トレーナー。

CodeGenTokenizer

バイト ペア エンコード モデルを表します。 で説明されている CodeGen トークナイザーを実装する https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

バイト ペア エンコード モデルを表します。

EnglishRobertaTokenizer

バイト ペア エンコード モデルを表します。

LlamaTokenizer

LlamaTokenizer は、 https://github.com/google/sentencepieceに基づいて実装される SentencePieceTokenizer です。

LowerCaseNormalizer

トークナイザーで処理する前に、文字列を小文字に正規化します。

Model

トークン化中に使用されるモデル (BPE、Word Piece、Unigram など) を表します。

Normalizer

トークナイザーで処理する前に、文字列を正規化します。

Phi2Tokenizer

バイト ペア エンコード モデルを表します。 で説明されている Phi2 トークナイザーを実装する https://huggingface.co/microsoft/phi-2

PreTokenizer

すべての事前トークナイザー クラスの基本クラス。 PreTokenizer は、事前セグメント化ステップの実行を担当します。

RegexPreTokenizer

Tiktoken トークナイザーの事前トークナイザー。

RobertaPreTokenizer

Roberta English トークナイザーの事前トークナイザー。

SentencePieceNormalizer

SentencePiece の正規化に従って文字列を正規化します。

SentencePieceTokenizer

SentencePieceBpe は、SentencePiece Bpe モデルを使用して入力をトークンに分割するトークナイザーです。

Split

この分割には、基になる分割トークンと、元の文字列内のオフセットが含まれます。 これらのオフセットは、 original 参照内にあります。 また、現在の分割に関連付けられている Token も含まれます。

TiktokenTokenizer

高速バイト ペア エンコード トークナイザーを表します。

Token

トークン部分文字列、トークン部分文字列に関連付けられた ID、および元の文字列へのオフセット マッピングを含むトークン化プロセスから生成されたトークンを表します。

Tokenizer

トークナイザーの抽象化を提供し、テキストをトークンにエンコードし、トークン ID をテキストにデコードできるようにします。

TokenizerDecoder

デコーダーは、文字列内のトークンの指定されたリストをマージする責任があります。

TokenizerResult

エンコードは、トークナイザーの出力を表します。

Trainer

Trainerには、モデルをトレーニングする責任があります。 私たちはそれを行/文で養い、与えられた Modelをトレーニングすることができます。

UpperCaseNormalizer

トークナイザーで処理する前に、文字列を大文字に正規化します。

WhiteSpace

単語の境界でテキストを分割する事前トークナイザー。 単語は、アルファベット、数字、およびアンダースコア文字のセットです。

WordPieceOptions

WordPiece トークナイザーのオプション。

WordPieceTokenizer

WordPiece トークナイザーを表します。

構造体

名前 説明
AddedToken

既存のモデル ボキャブラリの上にユーザーが追加したトークンを表します。 AddedToken は、次のようなさまざまな状況で必要な動作を指定するように構成できます。

  • 1 つの単語にのみ一致させる必要があるかどうか
  • WhiteSpace を左または右に含めるかどうか
EncodedToken

トークン部分文字列、トークン部分文字列に関連付けられた ID、および元の文字列へのオフセット マッピングを含むトークン化プロセスから生成されたトークンを表します。

EncodeResults<T>

テキストをエンコードした結果。

EncodeSettings

テキストのエンコードに使用される設定。

NormalizedString

正規化された文字列と、元の文字列へのマッピングを格納します。

Progress

列挙型

名前 説明
ProgressState

報告された進行状況の状態を表します。

代理人

名前 説明
ReportProgress