Idioma

BpeTokenizer.CreateAsync Método

Definição

Crie um novo objeto tokenizer Bpe de forma assíncrona para usar para codificação de texto.

public static System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer> CreateAsync(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member CreateAsync : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> System.Threading.Tasks.Task<Microsoft.ML.Tokenizers.BpeTokenizer>
Public Shared Function CreateAsync (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As Task(Of BpeTokenizer)

Parâmetros

vocabStream
Stream

O fluxo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.

mergesStream
Stream

O fluxo que contém a lista de pares dos tokens.

preTokenizer
PreTokenizer

O pré-tokenizador a ser usado.

normalizer
Normalizer

O normalizador a ser usado.

specialTokens
IReadOnlyDictionary<String,Int32>

O dicionário mapeando tokens especiais para IDs.

unknownToken
String

O token desconhecido a ser usado pelo modelo.

continuingSubwordPrefix
String

O prefixo a ser anexado a unidades de sub-palavra que não representam um início de palavra.

endOfWordSuffix
String

O sufixo a ser anexado a unidades de sub-palavra que representam o fim da palavra.

fuseUnknownTokens
Boolean

Indique se a permissão de vários tokens desconhecidos é fundida.

Retornos

Comentários

Ao criar o tokenizador, verifique se o fluxo de vocabulário é originado de um provedor confiável.

Aplica-se a