Idioma

BpeTokenizer.Create Método

Definição

Sobrecargas

Nome Description
Create(Stream, Stream)

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

Create(String, String)

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

Create(Stream, Stream)

Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer

Parâmetros

vocabStream
Stream

O fluxo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.

mergesStream
Stream

O fluxo que contém a lista de pares dos tokens.

Retornos

Comentários

Ao criar o tokenizador, verifique se o fluxo de vocabulário é originado de um provedor confiável.

Aplica-se a

Create(String, String)

Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer

Parâmetros

vocabFile
String

O caminho do arquivo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.

mergesFile
String

O caminho do arquivo que contém a lista de pares dos tokens.

Retornos

Comentários

Ao criar o tokenizador, verifique se o arquivo de vocabulário é originado de um provedor confiável.

Aplica-se a

Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parâmetros

vocabStream
Stream

O fluxo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.

mergesStream
Stream

O fluxo que contém a lista de pares dos tokens.

preTokenizer
PreTokenizer

O pré-tokenizador a ser usado.

normalizer
Normalizer

O normalizador a ser usado.

specialTokens
IReadOnlyDictionary<String,Int32>

O dicionário mapeando tokens especiais para IDs.

unknownToken
String

O token desconhecido a ser usado pelo modelo.

continuingSubwordPrefix
String

O prefixo a ser anexado a unidades de sub-palavra que não representam um início de palavra.

endOfWordSuffix
String

O sufixo a ser anexado a unidades de sub-palavra que representam o fim da palavra.

fuseUnknownTokens
Boolean

Indique se a permissão de vários tokens desconhecidos é fundida.

Retornos

Comentários

Ao criar o tokenizador, verifique se o fluxo de vocabulário é originado de um provedor confiável.

Aplica-se a

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs
Origem:
BPETokenizer.cs

Crie um novo objeto tokenizer Bpe a ser usado para codificação de texto.

public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer

Parâmetros

vocabFile
String

O caminho do arquivo JSON que contém o dicionário de chaves de cadeia de caracteres e suas IDs.

mergesFile
String

O caminho do arquivo que contém a lista de pares dos tokens.

preTokenizer
PreTokenizer

O pré-tokenizador a ser usado.

normalizer
Normalizer

O normalizador a ser usado.

specialTokens
IReadOnlyDictionary<String,Int32>

O dicionário mapeando tokens especiais para IDs.

unknownToken
String

O token desconhecido a ser usado pelo modelo.

continuingSubwordPrefix
String

O prefixo a ser anexado a unidades de sub-palavra que não representam um início de palavra.

endOfWordSuffix
String

O sufixo a ser anexado a unidades de sub-palavra que representam o fim da palavra.

fuseUnknownTokens
Boolean

Indique se a permissão de vários tokens desconhecidos é fundida.

Retornos

Comentários

Ao criar o tokenizador, verifique se o arquivo de vocabulário é originado de um provedor confiável.

Aplica-se a