Idioma

LlamaTokenizer Classe

Definição

LlamaTokenizer é SentencePieceTokenizer, que é implementado com base em https://github.com/google/sentencepiece.

public sealed class LlamaTokenizer : Microsoft.ML.Tokenizers.SentencePieceTokenizer
type LlamaTokenizer = class
    inherit SentencePieceTokenizer
Public NotInheritable Class LlamaTokenizer
Inherits SentencePieceTokenizer
Herança

Propriedades

Nome Description
AddBeginningOfSentence

Indique a emissão do início do token de sentença durante a codificação.

(Herdado de SentencePieceTokenizer)
AddDummyPrefix

Indique a emissão do caractere de prefixo U+2581 no início do token de sentença durante a normalização e a codificação.

(Herdado de SentencePieceTokenizer)
AddEndOfSentence

Indique a emissão do token de fim de sentença durante a codificação.

(Herdado de SentencePieceTokenizer)
BeginningOfSentenceId

A ID do início do token de sentença.

(Herdado de SentencePieceTokenizer)
BeginningOfSentenceToken

O início do token de sentença.

(Herdado de SentencePieceTokenizer)
ByteFallback

Especifica se o modelo fará um fallback de bytes quando encontrar tokens desconhecidos durante o processo de codificação.

(Herdado de SentencePieceTokenizer)
EndOfSentenceId

A ID do final do token de sentença.

(Herdado de SentencePieceTokenizer)
EndOfSentenceToken

O fim do token de sentença.

(Herdado de SentencePieceTokenizer)
EscapeWhiteSpaces

Indique se os espaços devem ser substituídos pelo caractere U+2581 durante a normalização e a codificação.

(Herdado de SentencePieceTokenizer)
Normalizer

Obtém o Normalizador em uso pelo Tokenizer.

(Herdado de SentencePieceTokenizer)
PreTokenizer

Obtém o PreTokenizer usado pelo Tokenizer.

(Herdado de SentencePieceTokenizer)
SpecialTokens

Os tokens especiais.

(Herdado de SentencePieceTokenizer)
TreatWhitespaceAsSuffix

Indique a emissão do caractere U+2581 no final do último token de sentença, em vez do início do token de sentença durante a normalização e a codificação.

(Herdado de SentencePieceTokenizer)
UnknownId

A ID do token desconhecido.

(Herdado de SentencePieceTokenizer)
UnknownToken

O token desconhecido.

(Herdado de SentencePieceTokenizer)
Vocabulary

O vocabulário do modelo.

(Herdado de SentencePieceTokenizer)

Métodos

Nome Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de SentencePieceTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de SentencePieceTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, String, Int32, Int32)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de SentencePieceTokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de SentencePieceTokenizer)
CountTokens(String, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de SentencePieceTokenizer)
Create(Stream, Boolean, Boolean, IReadOnlyDictionary<String,Int32>)

Crie a partir do fluxo de modelo fornecido um LlamaTokenizer baseado em SentencePieceTokenizer. O fluxo de modelo deve conter o modelo SentencePiece Bpe de acordo com a https://github.com/google/sentencepiece/blob/master/src/sentencepiece_model.proto especificação.

Decode(IEnumerable<Int32>, Boolean)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

(Herdado de SentencePieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

(Herdado de SentencePieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

(Herdado de SentencePieceTokenizer)
Decode(IEnumerable<Int32>)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

(Herdado de SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

(Herdado de SentencePieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

(Herdado de Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de SentencePieceTokenizer)
EncodeToIds(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

(Herdado de SentencePieceTokenizer)
EncodeToIds(String, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

<param name="text">O texto a ser codificado.</param> (Herdado de Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em IDs de token.

(Herdado de SentencePieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada de uma lista de EncodedTokens com o valor da cadeia de caracteres do token, da ID e do deslocamento.

(Herdado de SentencePieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de SentencePieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada de uma lista de EncodedTokens com o valor da cadeia de caracteres do token, da ID e do deslocamento.

(Herdado de SentencePieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

(Herdado de SentencePieceTokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, Boolean, Boolean, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

(Herdado de SentencePieceTokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Boolean, Boolean, Int32, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token.

(Herdado de SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCountFromEnd(String, Boolean, Boolean, Int32, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token.

(Herdado de SentencePieceTokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)

Aplica-se a