Język

EnglishRobertaTokenizer Klasa

Definicja

Reprezentuje model kodowania par bajtów.

public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
    inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
Dziedziczenie
EnglishRobertaTokenizer

Właściwości

Nazwa Opis
FilterUnsupportedChars

Wskaż, czy chcesz filtrować nieobsługiwane znaki podczas dekodowania.

Normalizer

Pobiera moduł normalizer używany przez tokenizator.

PadIndex

Pobiera indeks symbolu okienka na liście symboli.

PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

SymbolsCount

Pobiera długość listy symboli.

Vocabulary

Pobiera tokeny mapowania słownika na identyfikatory.

Metody

Nazwa Opis
AddMaskSymbol(String)

Dodaj symbol maski do listy symboli.

ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>)

Przekonwertuj listę identyfikatorów tokenu na najwyższe klasyfikacje wystąpień.

ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>)

Przekonwertuj listę identyfikatorów tokenu na najwyższe wartości wystąpień.

ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>)

Przekonwertuj listę najwyższych klasyfikacji wystąpień na listę identyfikatorów tokenu .

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean)

Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta.

Create(Stream, Stream, Stream)

Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta.

Create(String, String, String, PreTokenizer, Normalizer, Boolean)

Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta.

Create(String, String, String)

Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</param> (Odziedziczone po Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
IsSupportedChar(Char)

Sprawdź, czy znak jest obsługiwany przez model tokenizatora.

Dotyczy