Język

BpeTokenizer Klasa

Definicja

Reprezentuje model kodowania par bajtów.

public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
    inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
Dziedziczenie
BpeTokenizer

Właściwości

Nazwa Opis
ContinuingSubwordPrefix

Prefiks, który ma być używany dla każdego podwordu, który nie jest początkiem słowa

EndOfWordSuffix

Opcjonalny sufiks do scharakteryzowania i końca wyrazu podrzędnego

FuseUnknownTokens

Pobiera lub ustawia, czy zezwalanie na łączenie wielu nieznanych tokenów

Normalizer

Pobiera moduł normalizer używany przez tokenizator.

PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

SpecialTokens

Pobiera tokeny specjalne.

UnknownToken

Pobiera lub ustawia nieznany token. Nieznany token do użycia w przypadku napotkania nieznanego znaku

Vocabulary

Pobiera tokeny mapowania słownika na identyfikatory.

Metody

Nazwa Opis
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(Stream, Stream)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

Create(String, String)

Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.

CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Utwórz nowy obiekt tokenizatora Bpe asynchronicznie do użycia na potrzeby kodowania tekstu.

Decode(IEnumerable<Int32>, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</param> (Odziedziczone po Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)

Dotyczy