EnglishRobertaTokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Represent the Byte Pair Encoding model.
public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
- Vererbung
Eigenschaften
| Name | Beschreibung |
|---|---|
| FilterUnsupportedChars |
Geben Sie an, ob die nicht unterstützten Zeichen während der Decodierung gefiltert werden sollen. |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. |
| PadIndex |
Ruft den Index des Pad-Symbols in der Symbolliste ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. |
| SymbolsCount |
Ruft die Länge der Symbolliste ab. |
| Vocabulary |
Ruft die Wörterbuchzuordnungstoken zu IDs ab. |
Methoden
| Name | Beschreibung |
|---|---|
| AddMaskSymbol(String) |
Fügen Sie der Symbolliste das Maskensymbol hinzu. |
| ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>) |
Konvertieren Sie eine Liste von Token-IDs in höchste Vorkommen-Rangfolgen. |
| ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>) |
Konvertieren Sie eine Liste von Token-IDs in höchste Vorkommenswerte. |
| ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>) |
Konvertieren Sie eine Liste der höchsten Vorkommen-Rangfolgen in die Token-IDs-Liste. |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean) |
Erstellen Sie das Modellobjekt des Tokenizers, das mit dem englischen Robert-Modell verwendet werden soll. |
| Create(Stream, Stream, Stream) |
Erstellen Sie das Modellobjekt des Tokenizers, das mit dem englischen Robert-Modell verwendet werden soll. |
| Create(String, String, String, PreTokenizer, Normalizer, Boolean) |
Erstellen Sie das Modellobjekt des Tokenizers, das mit dem englischen Robert-Modell verwendet werden soll. |
| Create(String, String, String) |
Erstellen Sie das Modellobjekt des Tokenizers, das mit dem englischen Robert-Modell verwendet werden soll. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| IsSupportedChar(Char) |
Überprüfen Sie, ob das Zeichen vom Modell des Tokenizers unterstützt wird. |