EnglishRobertaTokenizer クラス

定義

バイト ペア エンコード モデルを表します。

public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
    inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
継承
EnglishRobertaTokenizer

プロパティ

名前 説明
FilterUnsupportedChars

デコード中にサポートされていない文字をフィルター処理するかどうかを示します。

Normalizer

トークナイザーで使用されているノーマライザーを取得します。

PadIndex

シンボル リスト内のパッド シンボルのインデックスを取得します。

PreTokenizer

トークナイザーで使用される PreTokenizer を取得します。

SymbolsCount

シンボル リストの長さを取得します。

Vocabulary

ID へのディクショナリ マッピング トークンを取得します。

メソッド

名前 説明
AddMaskSymbol(String)

記号リストにマスク記号を追加します。

ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>)

トークン ID の一覧を、最も高い出現順位に変換します。

ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>)

トークン ID の一覧を最も高い出現値に変換します。

ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>)

最も高い出現順位のリストをトークン ID リストに変換します。

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

入力テキストがエンコードされるトークンの数を取得します。

(継承元 Tokenizer)
CountTokens(String, Boolean, Boolean)

入力テキストがエンコードされるトークンの数を取得します。

(継承元 Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

入力テキストがエンコードされるトークンの数を取得します。

(継承元 Tokenizer)
Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean)

英語の Robert モデルで使用するトークナイザーのモデル オブジェクトを作成します。

Create(Stream, Stream, Stream)

英語の Robert モデルで使用するトークナイザーのモデル オブジェクトを作成します。

Create(String, String, String, PreTokenizer, Normalizer, Boolean)

英語の Robert モデルで使用するトークナイザーのモデル オブジェクトを作成します。

Create(String, String, String)

英語の Robert モデルで使用するトークナイザーのモデル オブジェクトを作成します。

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

指定された ID をテキストにデコードし、結果を destination スパンに格納します。

Decode(IEnumerable<Int32>)

指定した ID を文字列にデコードします。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

入力テキストをトークン ID にエンコードします。

(継承元 Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

最大トークン数までのトークン ID に入力テキストをエンコードします。

(継承元 Tokenizer)
EncodeToIds(String, Boolean, Boolean)

入力テキストをトークン ID にエンコードします。

(継承元 Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

最大トークン数までのトークン ID に入力テキストをエンコードします。

<param name="text">エンコードするテキスト</param> (継承元 Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

入力テキストをトークン ID にエンコードします。

(継承元 Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

入力テキストを EncodedTokenの一覧にエンコードします。

(継承元 Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

入力テキストを EncodedTokenの一覧にエンコードします。

(継承元 Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

入力テキストを EncodedTokenの一覧にエンコードします。

(継承元 Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

(継承元 Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

(継承元 Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

(継承元 Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

(継承元 Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

トークンの制限を超えることなく、最大エンコード容量のインデックスを見つけます。

(継承元 Tokenizer)
IsSupportedChar(Char)

トークナイザーのモデルで文字がサポートされているかどうかを確認します。

適用対象