BertTokenizer Klasa
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Tokenizer dla modelu Bert.
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- Dziedziczenie
Uwagi
BertTokenizer jest oparty na wordPieceTokenizer i służy do tokenizowania tekstu dla modeli Bert. Implementacja narzędzia BertTokenizer jest oparta na oryginalnej implementacji Bert w bibliotece Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
Właściwości
| Nazwa | Opis |
|---|---|
| ApplyBasicTokenization |
Pobiera wartość wskazującą, czy tokenizator powinien wykonać podstawową tokenizację. Podobnie jak czysty tekst, normalizuj go, małe litery itp. |
| ClassificationToken |
Pobiera token klasyfikatora, który jest używany podczas klasyfikacji sekwencji (klasyfikacja całej sekwencji zamiast klasyfikacji tokenów). Jest to pierwszy token sekwencji, który jest tworzony przy użyciu tokenów specjalnych. |
| ClassificationTokenId |
Pobiera identyfikator tokenu klasyfikatora |
| ContinuingSubwordPrefix |
Pobiera prefiks używany dla wyrazów podrzędnych, które nie są pierwszą częścią słowa. (Odziedziczone po WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
Pobiera wartość wskazującą, czy tokenizator powinien podzielić znaki CJK na tokeny. |
| LowerCaseBeforeTokenization |
Pobiera wartość wskazującą, czy tokenizator powinien zawierać małe litery tekstu wejściowego. |
| MaskingToken |
Pobiera token maski używany do maskowania wartości. Jest to token używany podczas trenowania tego modelu za pomocą modelowania języka maskowanego. Jest to token, który model spróbuje przewidzieć. |
| MaskingTokenId |
Pobiera identyfikator tokenu maski |
| MaxInputCharsPerWord |
Pobiera maksymalną liczbę znaków do autoryzowania w jednym słowie. (Odziedziczone po WordPieceTokenizer) |
| Normalizer |
Pobiera moduł normalizer używany przez tokenizator. (Odziedziczone po WordPieceTokenizer) |
| PaddingToken |
Pobiera token używany do wypełnienia, na przykład podczas dzielenia na partie sekwencji o różnych długościach |
| PaddingTokenId |
Pobiera identyfikator tokenu uzupełniania |
| PreTokenizer |
Pobiera pretokenizer używany przez tokenizator. (Odziedziczone po WordPieceTokenizer) |
| RemoveNonSpacingMarks |
Pobiera wartość wskazującą, czy usunąć znaki inne niż odstępy. |
| SeparatorToken |
Pobiera token separatora, który jest używany podczas tworzenia sekwencji z wielu sekwencji, np. dwóch sekwencji klasyfikacji sekwencji lub tekstu i pytania dotyczącego odpowiedzi na pytania. Jest on również używany jako ostatni token sekwencji skompilowany ze specjalnymi tokenami. |
| SeparatorTokenId |
Pobiera identyfikator tokenu separatora |
| SpecialTokens |
Pobiera tokeny specjalne i odpowiadające im identyfikatory. (Odziedziczone po WordPieceTokenizer) |
| SplitOnSpecialTokens |
Pobiera wartość wskazującą, czy tokenizator powinien podzielić się na specjalne tokeny, czy traktować tokeny specjalne jako zwykły tekst. |
| UnknownToken |
Pobiera nieznany token. Token, który nie znajduje się w słownictwie, nie może być konwertowany na identyfikator i jest ustawiony jako ten token. (Odziedziczone po WordPieceTokenizer) |
| UnknownTokenId |
Pobiera nieznany identyfikator tokenu. Token, który nie znajduje się w słownictwie, nie może być konwertowany na identyfikator i jest ustawiony jako ten token. (Odziedziczone po WordPieceTokenizer) |
Metody
| Nazwa | Opis |
|---|---|
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>) |
Kompilowanie danych wejściowych modelu z sekwencji lub pary sekwencji zadań klasyfikacji przez łączenie i dodawanie specjalnych tokenów. Sekwencja BERT ma następujący format: - pojedyncza sekwencja: |
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Kompilowanie danych wejściowych modelu z sekwencji lub pary sekwencji zadań klasyfikacji przez łączenie i dodawanie specjalnych tokenów. Sekwencja BERT ma następujący format: - pojedyncza sekwencja: |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po WordPieceTokenizer) |
| Create(Stream, BertOptions) |
Utwórz nowe wystąpienie klasy BertTokenizer. |
| Create(String, BertOptions) |
Utwórz nowe wystąpienie klasy BertTokenizer. |
| CreateAsync(Stream, BertOptions, CancellationToken) |
Utwórz nowe wystąpienie BertTokenizer klasy asynchronicznie. |
| CreateAsync(String, BertOptions, CancellationToken) |
Utwórz nowe wystąpienie BertTokenizer klasy asynchronicznie. |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>) |
Utwórz maskę z dwóch przekazanych sekwencji, które mają być używane w zadaniu klasyfikacji sekwencji par. Maska pary sekwencji BERT ma następujący format: 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 | pierwsza sekwencja | druga sekwencja | Jeśli |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Tokenizer dla modelu Bert. |
| Decode(IEnumerable<Int32>, Boolean) |
Zdekoduj podane identyfikatory z powrotem do ciągu. (Odziedziczone po WordPieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w |
| Decode(IEnumerable<Int32>) |
Zdekoduj podane identyfikatory z powrotem do ciągu. (Odziedziczone po WordPieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(String, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(String, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po WordPieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po WordPieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po WordPieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean) |
Pobieranie maski tokenów sekwencji z listy identyfikatorów. |
| GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean) |
Pobieranie maski tokenów sekwencji z listy identyfikatorów. |