Język

Tokenizer Klasa

Definicja

Zapewnia abstrakcję tokenizatorów, umożliwiając kodowanie tekstu w tokenach i dekodowanie identyfikatorów tokenów z powrotem do tekstu.

public abstract class Tokenizer
public class Tokenizer
type Tokenizer = class
Public MustInherit Class Tokenizer
Public Class Tokenizer
Dziedziczenie
Tokenizer
Pochodne

Konstruktory

Nazwa Opis
Tokenizer()

Inicjuje nowe wystąpienie klasy Tokenizer.

Tokenizer(Model, PreTokenizer, Normalizer)

Utwórz nowy obiekt Tokenizer.

Właściwości

Nazwa Opis
Decoder

Pobiera lub ustawia dekoder używany przez tokenizator.

Model

Pobiera model używany przez tokenizator.

Normalizer

Pobiera moduł normalizer używany przez tokenizator.

PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

Metody

Nazwa Opis
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

Decode(IEnumerable<Int32>, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

Decode(Int32, Boolean)

Dekoduje identyfikator do zamapowanego tokenu.

Encode(String)

Koduje tekst wejściowy do obiektu zawiera listę tokenów, identyfikatory tokenów, mapowanie przesunięcia tokenów.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</param>
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

TrainFromFiles(Trainer, ReportProgress, String[])

Trenowanie modelu tokenizatora przy użyciu plików wejściowych.

Dotyczy