LlamaTokenizer Klasa
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
LlamaTokenizer to SentencePieceTokenizer, który jest implementowany na podstawie elementu https://github.com/google/sentencepiece.
public sealed class LlamaTokenizer : Microsoft.ML.Tokenizers.SentencePieceTokenizer
type LlamaTokenizer = class
inherit SentencePieceTokenizer
Public NotInheritable Class LlamaTokenizer
Inherits SentencePieceTokenizer
- Dziedziczenie
Właściwości
| Nazwa | Opis |
|---|---|
| AddBeginningOfSentence |
Wskazuje emitowanie początku tokenu zdania podczas kodowania. (Odziedziczone po SentencePieceTokenizer) |
| AddDummyPrefix |
Wskazuje emitowanie znaku prefiksu U+2581 na początku tokenu zdania podczas normalizacji i kodowania. (Odziedziczone po SentencePieceTokenizer) |
| AddEndOfSentence |
Wskazuje emitowanie końca tokenu zdania podczas kodowania. (Odziedziczone po SentencePieceTokenizer) |
| BeginningOfSentenceId |
Identyfikator początku tokenu zdania. (Odziedziczone po SentencePieceTokenizer) |
| BeginningOfSentenceToken |
Początek tokenu zdania. (Odziedziczone po SentencePieceTokenizer) |
| ByteFallback |
Określa, czy model wykona rezerwowy bajt, gdy napotka nieznane tokeny podczas procesu kodowania. (Odziedziczone po SentencePieceTokenizer) |
| EndOfSentenceId |
Identyfikator końca tokenu zdania. (Odziedziczone po SentencePieceTokenizer) |
| EndOfSentenceToken |
Koniec tokenu zdania. (Odziedziczone po SentencePieceTokenizer) |
| EscapeWhiteSpaces |
Określ, czy spacje powinny zostać zastąpione znakiem U+2581 podczas normalizacji i kodowania. (Odziedziczone po SentencePieceTokenizer) |
| Normalizer |
Pobiera moduł normalizer używany przez tokenizator. (Odziedziczone po SentencePieceTokenizer) |
| PreTokenizer |
Pobiera pretokenizer używany przez tokenizator. (Odziedziczone po SentencePieceTokenizer) |
| SpecialTokens |
Tokeny specjalne. (Odziedziczone po SentencePieceTokenizer) |
| TreatWhitespaceAsSuffix |
Wskazuje emitowanie znaku U+2581 na końcu ostatniego tokenu zdania zamiast rozpoczynania tokenu zdania podczas normalizacji i kodowania. (Odziedziczone po SentencePieceTokenizer) |
| UnknownId |
Identyfikator nieznanego tokenu. (Odziedziczone po SentencePieceTokenizer) |
| UnknownToken |
Nieznany token. (Odziedziczone po SentencePieceTokenizer) |
| Vocabulary |
Słownictwo modelu. (Odziedziczone po SentencePieceTokenizer) |
Metody
| Nazwa | Opis |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy. (Odziedziczone po SentencePieceTokenizer) |
| Create(Stream, Boolean, Boolean, IReadOnlyDictionary<String,Int32>) |
Utwórz na podstawie danego strumienia modelu llamaTokenizer, który jest oparty na funkcji SentencePieceTokenizer. Strumień modelu powinien zawierać model SentencePiece Bpe zgodnie ze https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto specyfikacją. |
| Decode(IEnumerable<Int32>, Boolean) |
Zdekoduj podane identyfikatory z powrotem do ciągu. (Odziedziczone po SentencePieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w |
| Decode(IEnumerable<Int32>) |
Zdekoduj podane identyfikatory z powrotem do ciągu. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. (Odziedziczone po Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów. <param name="text">Tekst do zakodowania.</Param> (Odziedziczone po Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do identyfikatorów tokenu. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy listę EncodedTokens z wartością ciągu tokenu, identyfikatora i przesunięcia. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean, Boolean, Boolean) |
Koduje tekst wejściowy listę EncodedTokens z wartością ciągu tokenu, identyfikatora i przesunięcia. (Odziedziczone po SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Koduje tekst wejściowy do listy EncodedTokens. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu. (Odziedziczone po SentencePieceTokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu. (Odziedziczone po SentencePieceTokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Boolean, Boolean, Int32, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu. (Odziedziczone po SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Boolean, Boolean, Int32, Boolean, String, Int32) |
Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu. (Odziedziczone po SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu. (Odziedziczone po Tokenizer) |