Język

BertTokenizer Klasa

Definicja

Tokenizer dla modelu Bert.

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
Dziedziczenie

Uwagi

BertTokenizer jest oparty na wordPieceTokenizer i służy do tokenizowania tekstu dla modeli Bert. Implementacja narzędzia BertTokenizer jest oparta na oryginalnej implementacji Bert w bibliotece Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

Właściwości

Nazwa Opis
ApplyBasicTokenization

Pobiera wartość wskazującą, czy tokenizator powinien wykonać podstawową tokenizację. Podobnie jak czysty tekst, normalizuj go, małe litery itp.

ClassificationToken

Pobiera token klasyfikatora, który jest używany podczas klasyfikacji sekwencji (klasyfikacja całej sekwencji zamiast klasyfikacji tokenów). Jest to pierwszy token sekwencji, który jest tworzony przy użyciu tokenów specjalnych.

ClassificationTokenId

Pobiera identyfikator tokenu klasyfikatora

ContinuingSubwordPrefix

Pobiera prefiks używany dla wyrazów podrzędnych, które nie są pierwszą częścią słowa.

(Odziedziczone po WordPieceTokenizer)
IndividuallyTokenizeCjk

Pobiera wartość wskazującą, czy tokenizator powinien podzielić znaki CJK na tokeny.

LowerCaseBeforeTokenization

Pobiera wartość wskazującą, czy tokenizator powinien zawierać małe litery tekstu wejściowego.

MaskingToken

Pobiera token maski używany do maskowania wartości. Jest to token używany podczas trenowania tego modelu za pomocą modelowania języka maskowanego. Jest to token, który model spróbuje przewidzieć.

MaskingTokenId

Pobiera identyfikator tokenu maski

MaxInputCharsPerWord

Pobiera maksymalną liczbę znaków do autoryzowania w jednym słowie.

(Odziedziczone po WordPieceTokenizer)
Normalizer

Pobiera moduł normalizer używany przez tokenizator.

(Odziedziczone po WordPieceTokenizer)
PaddingToken

Pobiera token używany do wypełnienia, na przykład podczas dzielenia na partie sekwencji o różnych długościach

PaddingTokenId

Pobiera identyfikator tokenu uzupełniania

PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

(Odziedziczone po WordPieceTokenizer)
RemoveNonSpacingMarks

Pobiera wartość wskazującą, czy usunąć znaki inne niż odstępy.

SeparatorToken

Pobiera token separatora, który jest używany podczas tworzenia sekwencji z wielu sekwencji, np. dwóch sekwencji klasyfikacji sekwencji lub tekstu i pytania dotyczącego odpowiedzi na pytania. Jest on również używany jako ostatni token sekwencji skompilowany ze specjalnymi tokenami.

SeparatorTokenId

Pobiera identyfikator tokenu separatora

SpecialTokens

Pobiera tokeny specjalne i odpowiadające im identyfikatory.

(Odziedziczone po WordPieceTokenizer)
SplitOnSpecialTokens

Pobiera wartość wskazującą, czy tokenizator powinien podzielić się na specjalne tokeny, czy traktować tokeny specjalne jako zwykły tekst.

UnknownToken

Pobiera nieznany token. Token, który nie znajduje się w słownictwie, nie może być konwertowany na identyfikator i jest ustawiony jako ten token.

(Odziedziczone po WordPieceTokenizer)
UnknownTokenId

Pobiera nieznany identyfikator tokenu. Token, który nie znajduje się w słownictwie, nie może być konwertowany na identyfikator i jest ustawiony jako ten token.

(Odziedziczone po WordPieceTokenizer)

Metody

Nazwa Opis
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

Kompilowanie danych wejściowych modelu z sekwencji lub pary sekwencji zadań klasyfikacji przez łączenie i dodawanie specjalnych tokenów. Sekwencja BERT ma następujący format: - pojedyncza sekwencja: [CLS] tokenIds [SEP] - para sekwencji: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Kompilowanie danych wejściowych modelu z sekwencji lub pary sekwencji zadań klasyfikacji przez łączenie i dodawanie specjalnych tokenów. Sekwencja BERT ma następujący format: - pojedyncza sekwencja: [CLS] tokenIds [SEP] - para sekwencji: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po WordPieceTokenizer)
Create(Stream, BertOptions)

Utwórz nowe wystąpienie klasy BertTokenizer.

Create(String, BertOptions)

Utwórz nowe wystąpienie klasy BertTokenizer.

CreateAsync(Stream, BertOptions, CancellationToken)

Utwórz nowe wystąpienie BertTokenizer klasy asynchronicznie.

CreateAsync(String, BertOptions, CancellationToken)

Utwórz nowe wystąpienie BertTokenizer klasy asynchronicznie.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

Utwórz maskę z dwóch przekazanych sekwencji, które mają być używane w zadaniu klasyfikacji sekwencji par. Maska pary sekwencji BERT ma następujący format: 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 | pierwsza sekwencja | druga sekwencja | Jeśli additionalTokenIds ma wartość null, ta metoda zwraca tylko pierwszą część identyfikatorów typów (0).

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Tokenizer dla modelu Bert.

Decode(IEnumerable<Int32>, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po WordPieceTokenizer)
Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

Pobieranie maski tokenów sekwencji z listy identyfikatorów.

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

Pobieranie maski tokenów sekwencji z listy identyfikatorów.

Dotyczy