EnglishRobertaTokenizer Klasa
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Reprezentuje model kodowania par bajtów.
public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
- Dziedziczenie
Właściwości
| Nazwa | Opis |
|---|---|
| FilterUnsupportedChars |
Wskaż, czy chcesz filtrować nieobsługiwane znaki podczas dekodowania. |
| Normalizer |
Pobiera moduł normalizer używany przez tokenizator. |
| PadIndex |
Pobiera indeks symbolu okienka na liście symboli. |
| PreTokenizer |
Pobiera pretokenizer używany przez tokenizator. |
| SymbolsCount |
Pobiera długość listy symboli. |
| Vocabulary |
Pobiera tokeny mapowania słownika na identyfikatory. |
Metody
| Nazwa | Opis |
|---|---|
| AddMaskSymbol(String) |
Dodaj symbol maski do listy symboli. |
| ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>) |
Przekonwertuj listę identyfikatorów tokenu na najwyższe klasyfikacje wystąpień. |
| ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>) |
Przekonwertuj listę identyfikatorów tokenu na najwyższe wartości wystąpień. |
| ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>) |
Przekonwertuj listę najwyższych klasyfikacji wystąpień na listę identyfikatorów tokenu . |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean) |
Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta. |
| Create(Stream, Stream, Stream) |
Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta. |
| Create(String, String, String, PreTokenizer, Normalizer, Boolean) |
Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta. |
| Create(String, String, String) |
Utwórz obiekt modelu tokenizatora do użycia z angielskim modelem Roberta. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w |
| Decode(IEnumerable<Int32>) |
Zdekoduj podane identyfikatory z powrotem do ciągu. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. (Odziedziczone po Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. <param name="text">Tekst do zakodowania.</param> (Odziedziczone po Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| IsSupportedChar(Char) |
Sprawdź, czy znak jest obsługiwany przez model tokenizatora. |