LlamaTokenizer Classe
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
LlamaTokenizer é SentencePieceTokenizer, que é implementado com base em https://github.com/google/sentencepiece.
public sealed class LlamaTokenizer : Microsoft.ML.Tokenizers.SentencePieceTokenizer
type LlamaTokenizer = class
inherit SentencePieceTokenizer
Public NotInheritable Class LlamaTokenizer
Inherits SentencePieceTokenizer
- Herança
Propriedades
| Nome | Description |
|---|---|
| AddBeginningOfSentence |
Indique a emissão do início do token de sentença durante a codificação. (Herdado de SentencePieceTokenizer) |
| AddDummyPrefix |
Indique a emissão do caractere de prefixo U+2581 no início do token de sentença durante a normalização e a codificação. (Herdado de SentencePieceTokenizer) |
| AddEndOfSentence |
Indique a emissão do token de fim de sentença durante a codificação. (Herdado de SentencePieceTokenizer) |
| BeginningOfSentenceId |
A ID do início do token de sentença. (Herdado de SentencePieceTokenizer) |
| BeginningOfSentenceToken |
O início do token de sentença. (Herdado de SentencePieceTokenizer) |
| ByteFallback |
Especifica se o modelo fará um fallback de bytes quando encontrar tokens desconhecidos durante o processo de codificação. (Herdado de SentencePieceTokenizer) |
| EndOfSentenceId |
A ID do final do token de sentença. (Herdado de SentencePieceTokenizer) |
| EndOfSentenceToken |
O fim do token de sentença. (Herdado de SentencePieceTokenizer) |
| EscapeWhiteSpaces |
Indique se os espaços devem ser substituídos pelo caractere U+2581 durante a normalização e a codificação. (Herdado de SentencePieceTokenizer) |
| Normalizer |
Obtém o Normalizador em uso pelo Tokenizer. (Herdado de SentencePieceTokenizer) |
| PreTokenizer |
Obtém o PreTokenizer usado pelo Tokenizer. (Herdado de SentencePieceTokenizer) |
| SpecialTokens |
Os tokens especiais. (Herdado de SentencePieceTokenizer) |
| TreatWhitespaceAsSuffix |
Indique a emissão do caractere U+2581 no final do último token de sentença, em vez do início do token de sentença durante a normalização e a codificação. (Herdado de SentencePieceTokenizer) |
| UnknownId |
A ID do token desconhecido. (Herdado de SentencePieceTokenizer) |
| UnknownToken |
O token desconhecido. (Herdado de SentencePieceTokenizer) |
| Vocabulary |
O vocabulário do modelo. (Herdado de SentencePieceTokenizer) |
Métodos
| Nome | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de SentencePieceTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de SentencePieceTokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de SentencePieceTokenizer) |
| Create(Stream, Boolean, Boolean, IReadOnlyDictionary<String,Int32>) |
Crie a partir do fluxo de modelo fornecido um LlamaTokenizer baseado em SentencePieceTokenizer. O fluxo de modelo deve conter o modelo SentencePiece Bpe de acordo com a https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto especificação. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. (Herdado de SentencePieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. (Herdado de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. (Herdado de SentencePieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. (Herdado de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. (Herdado de SentencePieceTokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. <param name="text">O texto a ser codificado.</param> (Herdado de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em IDs de token. (Herdado de SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada de uma lista de EncodedTokens com o valor da cadeia de caracteres do token, da ID e do deslocamento. (Herdado de SentencePieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada de uma lista de EncodedTokens com o valor da cadeia de caracteres do token, da ID e do deslocamento. (Herdado de SentencePieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. (Herdado de SentencePieceTokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. (Herdado de SentencePieceTokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Boolean, Boolean, Int32, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token. (Herdado de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Boolean, Boolean, Int32, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token. (Herdado de SentencePieceTokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |