BertTokenizer Classe
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Tokenizer para o modelo Bert.
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- Herança
Comentários
O BertTokenizer é baseado no WordPieceTokenizer e é usado para tokenizar texto para modelos bert. A implementação do BertTokenizer baseia-se na implementação original de Bert na biblioteca Abraçando Transformadores de Rosto. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
Propriedades
| Nome | Description |
|---|---|
| ApplyBasicTokenization |
Obtém um valor que indica se o tokenizador deve fazer a tokenização básica. Como texto limpo, normalize-o, minúsculas etc. |
| ClassificationToken |
Obtém o token de classificador que é usado ao fazer a classificação de sequência (classificação de toda a sequência em vez de classificação por token). É o primeiro token da sequência quando criado com tokens especiais. |
| ClassificationTokenId |
Obtém a ID do token do classificador |
| ContinuingSubwordPrefix |
Obtém o prefixo a ser usado para sub-palavras que não são a primeira parte de uma palavra. (Herdado de WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
Obtém um valor que indica se o tokenizador deve dividir os caracteres CJK em tokens. |
| LowerCaseBeforeTokenization |
Obtém um valor que indica se o tokenizador deve reduzir o texto de entrada. |
| MaskingToken |
Obtém o token de máscara usado para mascarar valores. Esse é o token usado ao treinar esse modelo com modelagem de linguagem mascarada. Esse é o token que o modelo tentará prever. |
| MaskingTokenId |
Obtém a ID do token de máscara |
| MaxInputCharsPerWord |
Obtém o número máximo de caracteres a serem autorizados em uma única palavra. (Herdado de WordPieceTokenizer) |
| Normalizer |
Obtém o Normalizador em uso pelo Tokenizer. (Herdado de WordPieceTokenizer) |
| PaddingToken |
Obtém o token usado para preenchimento, por exemplo, ao agrupar sequências de tamanhos diferentes |
| PaddingTokenId |
Obtém a ID do token de preenchimento |
| PreTokenizer |
Obtém o PreTokenizer usado pelo Tokenizer. (Herdado de WordPieceTokenizer) |
| RemoveNonSpacingMarks |
Obtém um valor que indica se as marcas de não espaçamento devem ser removidas. |
| SeparatorToken |
Obtém o token separador, que é usado ao criar uma sequência de várias sequências, por exemplo, duas sequências para classificação de sequência ou para um texto e uma pergunta para responder a perguntas. Ele também é usado como o último token de uma sequência criada com tokens especiais. |
| SeparatorTokenId |
Obtém a ID do token separador |
| SpecialTokens |
Obtém os tokens especiais e suas IDs correspondentes. (Herdado de WordPieceTokenizer) |
| SplitOnSpecialTokens |
Obtém um valor que indica se o tokenizador deve ser dividido nos tokens especiais ou tratar tokens especiais como texto normal. |
| UnknownToken |
Obtém o token desconhecido. Um token que não está no vocabulário não pode ser convertido em uma ID e é definido como sendo esse token. (Herdado de WordPieceTokenizer) |
| UnknownTokenId |
Obtém a ID do token desconhecido. Um token que não está no vocabulário não pode ser convertido em uma ID e é definido como sendo esse token. (Herdado de WordPieceTokenizer) |
Métodos
| Nome | Description |
|---|---|
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>) |
Crie entradas de modelo de uma sequência ou um par de sequências para tarefas de classificação de sequência, concatenando e adicionando tokens especiais. Uma sequência BERT tem o seguinte formato: - sequência única: |
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Crie entradas de modelo de uma sequência ou um par de sequências para tarefas de classificação de sequência, concatenando e adicionando tokens especiais. Uma sequência BERT tem o seguinte formato: - sequência única: |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de WordPieceTokenizer) |
| Create(Stream, BertOptions) |
Crie uma nova instância da BertTokenizer classe . |
| Create(String, BertOptions) |
Crie uma nova instância da BertTokenizer classe . |
| CreateAsync(Stream, BertOptions, CancellationToken) |
Crie uma nova instância da BertTokenizer classe de forma assíncrona. |
| CreateAsync(String, BertOptions, CancellationToken) |
Crie uma nova instância da BertTokenizer classe de forma assíncrona. |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>) |
Crie uma máscara das duas sequências passadas para serem usadas em uma tarefa de classificação de par de sequências. Uma máscara de par de sequência BERT tem o seguinte formato: 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 | primeira sequência | segunda sequência | Se |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Tokenizer para o modelo Bert. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. (Herdado de WordPieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. (Herdado de WordPieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em IDs de token. (Herdado de WordPieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de WordPieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de WordPieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean) |
Recupere a máscara de tokens de sequência de uma lista de IDs. |
| GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean) |
Recupere a máscara de tokens de sequência de uma lista de IDs. |