Microsoft.ML.Tokenizers Przestrzeń nazw
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Klasy
| Nazwa | Opis |
|---|---|
| BertOptions |
Opcje tokenizatora Bert. |
| BertTokenizer |
Tokenizer dla modelu Bert. |
| BitVector | |
| Bpe |
Reprezentuje model kodowania par bajtów. |
| BpeDecoder |
Umożliwia dekodowanie oryginalnego narzędzia BPE przez dołączenie wszystkich tokenów, a następnie zastąpienie sufiksu używanego do identyfikowania końca wyrazów przez białe spacje |
| BpeTokenizer |
Reprezentuje model kodowania par bajtów. |
| BpeTrainer |
Trener Bpe odpowiedzialny za szkolenie modelu Bpe. |
| CodeGenTokenizer |
Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora CodeGen opisanego w temacie https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview |
| DawgBuilder | |
| EnglishRoberta |
Reprezentuje model kodowania par bajtów. |
| EnglishRobertaTokenizer |
Reprezentuje model kodowania par bajtów. |
| LlamaTokenizer |
LlamaTokenizer to SentencePieceTokenizer, który jest implementowany na podstawie elementu https://github.com/google/sentencepiece. |
| LowerCaseNormalizer |
Normalizuj ciąg do małego formularza przed przetworzeniem go za pomocą tokenizatora. |
| Model |
Reprezentuje model używany podczas tokenizacji (np. BPE lub Word Piece lub Unigram). |
| Normalizer |
Normalizuj ciąg przed przetworzeniem go za pomocą tokenizatora. |
| Phi2Tokenizer |
Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora Phi2 opisanego w temacie https://huggingface.co/microsoft/phi-2 |
| PreTokenizer |
Klasa bazowa dla wszystkich klas pre-tokenizers. PreTokenizer jest odpowiedzialny za wykonanie kroku wstępnego segmentacji. |
| RegexPreTokenizer |
Pre-tokenizer dla tokenizatora Tiktoken. |
| RobertaPreTokenizer |
Pre-tokenizer dla tokenizatora Roberta English. |
| SentencePieceNormalizer |
Normalizuj ciąg zgodnie z normalizacją SentencePiece. |
| SentencePieceTokenizer |
SentencePieceBpe to tokenizer, który dzieli dane wejściowe na tokeny przy użyciu modelu SentencePiece Bpe. |
| Split |
Ten podział zawiera podstawowy token podziału, a także jego przesunięcia w oryginalnym ciągu. Te przesunięcia znajdują się w odwołaniu |
| TiktokenTokenizer |
Reprezentuje tokenizer kodowania szybkiej pary bajtów. |
| Token |
Reprezentuje token wygenerowany z procesu tokenizacji zawierającego podciąg tokenu, identyfikator skojarzony z podciągem tokenu i mapowanie przesunięcia na oryginalny ciąg. |
| Tokenizer |
Zapewnia abstrakcję tokenizatorów, umożliwiając kodowanie tekstu w tokenach i dekodowanie identyfikatorów tokenów z powrotem do tekstu. |
| TokenizerDecoder |
Decoder ma obowiązek scalić daną listę tokenów w ciągu. |
| TokenizerResult |
Kodowanie reprezentuje dane wyjściowe tokenizatora. |
| Trainer |
Element ma |
| UpperCaseNormalizer |
Normalizuj ciąg na wielkie litery przed przetworzeniem go za pomocą tokenizatora. |
| WhiteSpace |
Pre-tokenizer dzielący tekst na granicy słowa. Wyraz jest zestawem znaków alfabetu, liczbowego i podkreślenia. |
| WordPieceOptions |
Opcje tokenizatora programu WordPiece. |
| WordPieceTokenizer |
Reprezentuje tokenizer programu WordPiece. |
Struktury
| Nazwa | Opis |
|---|---|
| AddedToken |
Reprezentowanie tokenu dodanego przez użytkownika na podstawie istniejącego słownictwa modelu. Wartość AddedToken można skonfigurować tak, aby określić zachowanie, które powinny mieć w różnych sytuacjach, takich jak:
|
| EncodedToken |
Reprezentuje token wygenerowany z procesu tokenizacji zawierającego podciąg tokenu, identyfikator skojarzony z podciągem tokenu i mapowanie przesunięcia na oryginalny ciąg. |
| EncodeResults<T> |
Wynik kodowania tekstu. |
| EncodeSettings |
Ustawienia używane do kodowania tekstu. |
| NormalizedString |
Zawiera znormalizowany ciąg i mapowanie na oryginalny ciąg. |
| Progress | |
Wyliczenia
| Nazwa | Opis |
|---|---|
| ProgressState |
Reprezentuje stan zgłoszonego postępu. |
Delegaci
| Nazwa | Opis |
|---|---|
| ReportProgress | |