Język

Phi2Tokenizer Klasa

Definicja

Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora Phi2 opisanego w temacie https://huggingface.co/microsoft/phi-2

public sealed class Phi2Tokenizer : Microsoft.ML.Tokenizers.CodeGenTokenizer
type Phi2Tokenizer = class
    inherit CodeGenTokenizer
Public NotInheritable Class Phi2Tokenizer
Inherits CodeGenTokenizer
Dziedziczenie

Właściwości

Nazwa Opis
AddBeginningOfSentence

Pobiera flagę wskazującą, czy dołączyć początek tokenu zdania do kodowania.

(Odziedziczone po CodeGenTokenizer)
AddEndOfSentence

Pobiera flagę wskazującą, czy w kodowaniu należy uwzględnić koniec tokenu zdania.

(Odziedziczone po CodeGenTokenizer)
AddPrefixSpace

Pobiera flagę wskazującą, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

(Odziedziczone po CodeGenTokenizer)
BeginningOfSentenceId

Pobiera koniec identyfikatora tokenu zdania.

(Odziedziczone po CodeGenTokenizer)
BeginningOfSentenceToken

Pobiera początek tokenu zdania.

(Odziedziczone po CodeGenTokenizer)
EndOfSentenceId

Pobiera koniec identyfikatora tokenu zdania.

(Odziedziczone po CodeGenTokenizer)
EndOfSentenceToken

Pobiera koniec tokenu zdania.

(Odziedziczone po CodeGenTokenizer)
Normalizer

Pobiera moduł normalizer używany przez tokenizator.

(Odziedziczone po CodeGenTokenizer)
PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

(Odziedziczone po CodeGenTokenizer)
SpecialTokens

Pobiera dodane tokeny.

(Odziedziczone po CodeGenTokenizer)
UnknownToken

Nieznany token.

(Odziedziczone po CodeGenTokenizer)
UnknownTokenId

Pobiera nieznany identyfikator tokenu.

(Odziedziczone po CodeGenTokenizer)
Vocabulary

Pobiera tokeny mapowania słownika na identyfikatory.

(Odziedziczone po CodeGenTokenizer)

Metody

Nazwa Opis
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po CodeGenTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po CodeGenTokenizer)
CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po CodeGenTokenizer)
Create(Stream, Stream, Boolean, Boolean, Boolean)

Utwórz tokenizator CodeGen Phi2 na podstawie danego wywołania i scala strumienie.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po CodeGenTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po CodeGenTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

(Odziedziczone po CodeGenTokenizer)
Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

(Odziedziczone po CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</param> (Odziedziczone po Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po CodeGenTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Koduje tekst wejściowy do obiektu zawiera listę tokenów, identyfikatory tokenów, mapowanie przesunięcia tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Koduje tekst wejściowy do obiektu zawiera listę tokenów, identyfikatory tokenów, mapowanie przesunięcia tokenów.

(Odziedziczone po CodeGenTokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po CodeGenTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

(Odziedziczone po CodeGenTokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

(Odziedziczone po CodeGenTokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po CodeGenTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

(Odziedziczone po CodeGenTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

(Odziedziczone po CodeGenTokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)

Dotyczy