BpeTokenizer.CreateAsync Método
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Crie um novo objeto tokenizer Bpe de forma assíncrona para usar para codificação de texto.
public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)
Parâmetros
- vocabStream
- Stream
O fluxo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.
- mergesStream
- Stream
O fluxo que contém a lista de pares dos tokens.
- preTokenizer
- PreTokenizer
O pré-tokenizador a ser usado.
- normalizer
- Normalizer
O normalizador a ser usado.
- specialTokens
- IReadOnlyDictionary<String,Int32>
O dicionário mapeando tokens especiais para IDs.
- unknownToken
- String
O token desconhecido a ser usado pelo modelo.
- continuingSubwordPrefix
- String
O prefixo a ser anexado a unidades de sub-palavra que não representam um início de palavra.
- endOfWordSuffix
- String
O sufixo a ser anexado a unidades de sub-palavra que representam o fim da palavra.
- fuseUnknownTokens
- Boolean
Indique se a permissão de vários tokens desconhecidos é fundida.
Retornos
Comentários
Ao criar o tokenizador, verifique se o fluxo de vocabulário é originado de um provedor confiável.