Język

LlamaTokenizer Klasa

Definicja

LlamaTokenizer to SentencePieceTokenizer, który jest implementowany na podstawie elementu https://github.com/google/sentencepiece.

public sealed class LlamaTokenizer : Microsoft.ML.Tokenizers.SentencePieceTokenizer
type LlamaTokenizer = class
    inherit SentencePieceTokenizer
Public NotInheritable Class LlamaTokenizer
Inherits SentencePieceTokenizer
Dziedziczenie

Właściwości

Nazwa Opis
AddBeginningOfSentence

Wskazuje emitowanie początku tokenu zdania podczas kodowania.

(Odziedziczone po SentencePieceTokenizer)
AddDummyPrefix

Wskazuje emitowanie znaku prefiksu U+2581 na początku tokenu zdania podczas normalizacji i kodowania.

(Odziedziczone po SentencePieceTokenizer)
AddEndOfSentence

Wskazuje emitowanie końca tokenu zdania podczas kodowania.

(Odziedziczone po SentencePieceTokenizer)
BeginningOfSentenceId

Identyfikator początku tokenu zdania.

(Odziedziczone po SentencePieceTokenizer)
BeginningOfSentenceToken

Początek tokenu zdania.

(Odziedziczone po SentencePieceTokenizer)
ByteFallback

Określa, czy model wykona rezerwowy bajt, gdy napotka nieznane tokeny podczas procesu kodowania.

(Odziedziczone po SentencePieceTokenizer)
EndOfSentenceId

Identyfikator końca tokenu zdania.

(Odziedziczone po SentencePieceTokenizer)
EndOfSentenceToken

Koniec tokenu zdania.

(Odziedziczone po SentencePieceTokenizer)
EscapeWhiteSpaces

Określ, czy spacje powinny zostać zastąpione znakiem U+2581 podczas normalizacji i kodowania.

(Odziedziczone po SentencePieceTokenizer)
Normalizer

Pobiera moduł normalizer używany przez tokenizator.

(Odziedziczone po SentencePieceTokenizer)
PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

(Odziedziczone po SentencePieceTokenizer)
SpecialTokens

Tokeny specjalne.

(Odziedziczone po SentencePieceTokenizer)
TreatWhitespaceAsSuffix

Wskazuje emitowanie znaku U+2581 na końcu ostatniego tokenu zdania zamiast rozpoczynania tokenu zdania podczas normalizacji i kodowania.

(Odziedziczone po SentencePieceTokenizer)
UnknownId

Identyfikator nieznanego tokenu.

(Odziedziczone po SentencePieceTokenizer)
UnknownToken

Nieznany token.

(Odziedziczone po SentencePieceTokenizer)
Vocabulary

Słownictwo modelu.

(Odziedziczone po SentencePieceTokenizer)

Metody

Nazwa Opis
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po SentencePieceTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po SentencePieceTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po SentencePieceTokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po SentencePieceTokenizer)
CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po SentencePieceTokenizer)
Create(Stream, Boolean, Boolean, IReadOnlyDictionary<String,Int32>)

Utwórz na podstawie danego strumienia modelu llamaTokenizer, który jest oparty na funkcji SentencePieceTokenizer. Strumień modelu powinien zawierać model SentencePiece Bpe zgodnie ze https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto specyfikacją.

Decode(IEnumerable<Int32>, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po SentencePieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po SentencePieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po SentencePieceTokenizer)
Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po SentencePieceTokenizer)
EncodeToIds(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po SentencePieceTokenizer)
EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</Param> (Odziedziczone po Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po SentencePieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy listę EncodedTokens z wartością ciągu tokenu, identyfikatora i przesunięcia.

(Odziedziczone po SentencePieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po SentencePieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy listę EncodedTokens z wartością ciągu tokenu, identyfikatora i przesunięcia.

(Odziedziczone po SentencePieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

(Odziedziczone po SentencePieceTokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

(Odziedziczone po SentencePieceTokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Boolean, Boolean, Int32, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

(Odziedziczone po SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Boolean, Boolean, Int32, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

(Odziedziczone po SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)

Dotyczy