Microsoft.ML.Tokenizers Przestrzeń nazw

Klasy

Nazwa Opis
BertOptions

Opcje tokenizatora Bert.

BertTokenizer

Tokenizer dla modelu Bert.

BitVector
Bpe

Reprezentuje model kodowania par bajtów.

BpeDecoder

Umożliwia dekodowanie oryginalnego narzędzia BPE przez dołączenie wszystkich tokenów, a następnie zastąpienie sufiksu używanego do identyfikowania końca wyrazów przez białe spacje

BpeTokenizer

Reprezentuje model kodowania par bajtów.

BpeTrainer

Trener Bpe odpowiedzialny za szkolenie modelu Bpe.

CodeGenTokenizer

Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora CodeGen opisanego w temacie https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Reprezentuje model kodowania par bajtów.

EnglishRobertaTokenizer

Reprezentuje model kodowania par bajtów.

LlamaTokenizer

LlamaTokenizer to SentencePieceTokenizer, który jest implementowany na podstawie elementu https://github.com/google/sentencepiece.

LowerCaseNormalizer

Normalizuj ciąg do małego formularza przed przetworzeniem go za pomocą tokenizatora.

Model

Reprezentuje model używany podczas tokenizacji (np. BPE lub Word Piece lub Unigram).

Normalizer

Normalizuj ciąg przed przetworzeniem go za pomocą tokenizatora.

Phi2Tokenizer

Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora Phi2 opisanego w temacie https://huggingface.co/microsoft/phi-2

PreTokenizer

Klasa bazowa dla wszystkich klas pre-tokenizers. PreTokenizer jest odpowiedzialny za wykonanie kroku wstępnego segmentacji.

RegexPreTokenizer

Pre-tokenizer dla tokenizatora Tiktoken.

RobertaPreTokenizer

Pre-tokenizer dla tokenizatora Roberta English.

SentencePieceNormalizer

Normalizuj ciąg zgodnie z normalizacją SentencePiece.

SentencePieceTokenizer

SentencePieceBpe to tokenizer, który dzieli dane wejściowe na tokeny przy użyciu modelu SentencePiece Bpe.

Split

Ten podział zawiera podstawowy token podziału, a także jego przesunięcia w oryginalnym ciągu. Te przesunięcia znajdują się w odwołaniu original . Zawiera również wszystkie Token skojarzone z bieżącym podziałem.

TiktokenTokenizer

Reprezentuje tokenizer kodowania szybkiej pary bajtów.

Token

Reprezentuje token wygenerowany z procesu tokenizacji zawierającego podciąg tokenu, identyfikator skojarzony z podciągem tokenu i mapowanie przesunięcia na oryginalny ciąg.

Tokenizer

Zapewnia abstrakcję tokenizatorów, umożliwiając kodowanie tekstu w tokenach i dekodowanie identyfikatorów tokenów z powrotem do tekstu.

TokenizerDecoder

Decoder ma obowiązek scalić daną listę tokenów w ciągu.

TokenizerResult

Kodowanie reprezentuje dane wyjściowe tokenizatora.

Trainer

Element ma Trainer obowiązek wytrenować model. Karmimy go wierszami/zdaniami, a następnie możemy wytrenować dany Modelelement .

UpperCaseNormalizer

Normalizuj ciąg na wielkie litery przed przetworzeniem go za pomocą tokenizatora.

WhiteSpace

Pre-tokenizer dzielący tekst na granicy słowa. Wyraz jest zestawem znaków alfabetu, liczbowego i podkreślenia.

WordPieceOptions

Opcje tokenizatora programu WordPiece.

WordPieceTokenizer

Reprezentuje tokenizer programu WordPiece.

Struktury

Nazwa Opis
AddedToken

Reprezentowanie tokenu dodanego przez użytkownika na podstawie istniejącego słownictwa modelu. Wartość AddedToken można skonfigurować tak, aby określić zachowanie, które powinny mieć w różnych sytuacjach, takich jak:

  • Czy powinny one być zgodne tylko z pojedynczymi słowami
  • Czy należy uwzględnić dowolny biały znak po lewej lub prawej stronie
EncodedToken

Reprezentuje token wygenerowany z procesu tokenizacji zawierającego podciąg tokenu, identyfikator skojarzony z podciągem tokenu i mapowanie przesunięcia na oryginalny ciąg.

EncodeResults<T>

Wynik kodowania tekstu.

EncodeSettings

Ustawienia używane do kodowania tekstu.

NormalizedString

Zawiera znormalizowany ciąg i mapowanie na oryginalny ciąg.

Progress

Wyliczenia

Nazwa Opis
ProgressState

Reprezentuje stan zgłoszonego postępu.

Delegaci

Nazwa Opis
ReportProgress