Microsoft.ML.Tokenizers 名前空間
重要
一部の情報は、リリース前に大きく変更される可能性があるプレリリースされた製品に関するものです。 Microsoft は、ここに記載されている情報について、明示または黙示を問わず、一切保証しません。
クラス
| 名前 | 説明 |
|---|---|
| BertOptions |
Bert トークナイザーのオプション。 |
| BertTokenizer |
Bert モデルのトークナイザー。 |
| BitVector | |
| Bpe |
バイト ペア エンコード モデルを表します。 |
| BpeDecoder |
すべてのトークンを結合し、単語の終わりを空白で識別するために使用されるサフィックスを置き換えることで、元の BPE をデコードできるようにします |
| BpeTokenizer |
バイト ペア エンコード モデルを表します。 |
| BpeTrainer |
Bpe モデルのトレーニングを担当する Bpe トレーナー。 |
| CodeGenTokenizer |
バイト ペア エンコード モデルを表します。 で説明されている CodeGen トークナイザーを実装する https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
バイト ペア エンコード モデルを表します。 |
| EnglishRobertaTokenizer |
バイト ペア エンコード モデルを表します。 |
| LlamaTokenizer |
LlamaTokenizer は、 https://github.com/google/sentencepieceに基づいて実装される SentencePieceTokenizer です。 |
| LowerCaseNormalizer |
トークナイザーで処理する前に、文字列を小文字に正規化します。 |
| Model |
トークン化中に使用されるモデル (BPE、Word Piece、Unigram など) を表します。 |
| Normalizer |
トークナイザーで処理する前に、文字列を正規化します。 |
| Phi2Tokenizer |
バイト ペア エンコード モデルを表します。 で説明されている Phi2 トークナイザーを実装する https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
すべての事前トークナイザー クラスの基本クラス。 PreTokenizer は、事前セグメント化ステップの実行を担当します。 |
| RegexPreTokenizer |
Tiktoken トークナイザーの事前トークナイザー。 |
| RobertaPreTokenizer |
Roberta English トークナイザーの事前トークナイザー。 |
| SentencePieceNormalizer |
SentencePiece の正規化に従って文字列を正規化します。 |
| SentencePieceTokenizer |
SentencePieceBpe は、SentencePiece Bpe モデルを使用して入力をトークンに分割するトークナイザーです。 |
| Split |
この分割には、基になる分割トークンと、元の文字列内のオフセットが含まれます。 これらのオフセットは、 |
| TiktokenTokenizer |
高速バイト ペア エンコード トークナイザーを表します。 |
| Token |
トークン部分文字列、トークン部分文字列に関連付けられた ID、および元の文字列へのオフセット マッピングを含むトークン化プロセスから生成されたトークンを表します。 |
| Tokenizer |
トークナイザーの抽象化を提供し、テキストをトークンにエンコードし、トークン ID をテキストにデコードできるようにします。 |
| TokenizerDecoder |
デコーダーは、文字列内のトークンの指定されたリストをマージする責任があります。 |
| TokenizerResult |
エンコードは、トークナイザーの出力を表します。 |
| Trainer |
|
| UpperCaseNormalizer |
トークナイザーで処理する前に、文字列を大文字に正規化します。 |
| WhiteSpace |
単語の境界でテキストを分割する事前トークナイザー。 単語は、アルファベット、数字、およびアンダースコア文字のセットです。 |
| WordPieceOptions |
WordPiece トークナイザーのオプション。 |
| WordPieceTokenizer |
WordPiece トークナイザーを表します。 |
構造体
| 名前 | 説明 |
|---|---|
| AddedToken |
既存のモデル ボキャブラリの上にユーザーが追加したトークンを表します。 AddedToken は、次のようなさまざまな状況で必要な動作を指定するように構成できます。
|
| EncodedToken |
トークン部分文字列、トークン部分文字列に関連付けられた ID、および元の文字列へのオフセット マッピングを含むトークン化プロセスから生成されたトークンを表します。 |
| EncodeResults<T> |
テキストをエンコードした結果。 |
| EncodeSettings |
テキストのエンコードに使用される設定。 |
| NormalizedString |
正規化された文字列と、元の文字列へのマッピングを格納します。 |
| Progress | |
列挙型
| 名前 | 説明 |
|---|---|
| ProgressState |
報告された進行状況の状態を表します。 |
代理人
| 名前 | 説明 |
|---|---|
| ReportProgress | |