Idioma

BertTokenizer Classe

Definição

Tokenizer para o modelo Bert.

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
Herança

Comentários

O BertTokenizer é baseado no WordPieceTokenizer e é usado para tokenizar texto para modelos bert. A implementação do BertTokenizer baseia-se na implementação original de Bert na biblioteca Abraçando Transformadores de Rosto. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

Propriedades

Nome Description
ApplyBasicTokenization

Obtém um valor que indica se o tokenizador deve fazer a tokenização básica. Como texto limpo, normalize-o, minúsculas etc.

ClassificationToken

Obtém o token de classificador que é usado ao fazer a classificação de sequência (classificação de toda a sequência em vez de classificação por token). É o primeiro token da sequência quando criado com tokens especiais.

ClassificationTokenId

Obtém a ID do token do classificador

ContinuingSubwordPrefix

Obtém o prefixo a ser usado para sub-palavras que não são a primeira parte de uma palavra.

(Herdado de WordPieceTokenizer)
IndividuallyTokenizeCjk

Obtém um valor que indica se o tokenizador deve dividir os caracteres CJK em tokens.

LowerCaseBeforeTokenization

Obtém um valor que indica se o tokenizador deve reduzir o texto de entrada.

MaskingToken

Obtém o token de máscara usado para mascarar valores. Esse é o token usado ao treinar esse modelo com modelagem de linguagem mascarada. Esse é o token que o modelo tentará prever.

MaskingTokenId

Obtém a ID do token de máscara

MaxInputCharsPerWord

Obtém o número máximo de caracteres a serem autorizados em uma única palavra.

(Herdado de WordPieceTokenizer)
Normalizer

Obtém o Normalizador em uso pelo Tokenizer.

(Herdado de WordPieceTokenizer)
PaddingToken

Obtém o token usado para preenchimento, por exemplo, ao agrupar sequências de tamanhos diferentes

PaddingTokenId

Obtém a ID do token de preenchimento

PreTokenizer

Obtém o PreTokenizer usado pelo Tokenizer.

(Herdado de WordPieceTokenizer)
RemoveNonSpacingMarks

Obtém um valor que indica se as marcas de não espaçamento devem ser removidas.

SeparatorToken

Obtém o token separador, que é usado ao criar uma sequência de várias sequências, por exemplo, duas sequências para classificação de sequência ou para um texto e uma pergunta para responder a perguntas. Ele também é usado como o último token de uma sequência criada com tokens especiais.

SeparatorTokenId

Obtém a ID do token separador

SpecialTokens

Obtém os tokens especiais e suas IDs correspondentes.

(Herdado de WordPieceTokenizer)
SplitOnSpecialTokens

Obtém um valor que indica se o tokenizador deve ser dividido nos tokens especiais ou tratar tokens especiais como texto normal.

UnknownToken

Obtém o token desconhecido. Um token que não está no vocabulário não pode ser convertido em uma ID e é definido como sendo esse token.

(Herdado de WordPieceTokenizer)
UnknownTokenId

Obtém a ID do token desconhecido. Um token que não está no vocabulário não pode ser convertido em uma ID e é definido como sendo esse token.

(Herdado de WordPieceTokenizer)

Métodos

Nome Description
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

Crie entradas de modelo de uma sequência ou um par de sequências para tarefas de classificação de sequência, concatenando e adicionando tokens especiais. Uma sequência BERT tem o seguinte formato: - sequência única: [CLS] tokenIds [SEP] - par de sequências: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Crie entradas de modelo de uma sequência ou um par de sequências para tarefas de classificação de sequência, concatenando e adicionando tokens especiais. Uma sequência BERT tem o seguinte formato: - sequência única: [CLS] tokenIds [SEP] - par de sequências: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de WordPieceTokenizer)
Create(Stream, BertOptions)

Crie uma nova instância da BertTokenizer classe .

Create(String, BertOptions)

Crie uma nova instância da BertTokenizer classe .

CreateAsync(Stream, BertOptions, CancellationToken)

Crie uma nova instância da BertTokenizer classe de forma assíncrona.

CreateAsync(String, BertOptions, CancellationToken)

Crie uma nova instância da BertTokenizer classe de forma assíncrona.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

Crie uma máscara das duas sequências passadas para serem usadas em uma tarefa de classificação de par de sequências. Uma máscara de par de sequência BERT tem o seguinte formato: 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 | primeira sequência | segunda sequência | Se additionalTokenIds for nulo, esse método retornará apenas a primeira parte das IDs de tipo (0s).

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Tokenizer para o modelo Bert.

Decode(IEnumerable<Int32>, Boolean)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

(Herdado de WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

(Herdado de WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

(Herdado de WordPieceTokenizer)
Decode(IEnumerable<Int32>)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

(Herdado de WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em IDs de token.

(Herdado de WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

Recupere a máscara de tokens de sequência de uma lista de IDs.

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

Recupere a máscara de tokens de sequência de uma lista de IDs.

Aplica-se a