Idioma

CodeGenTokenizer.EncodeToIds Método

Definição

Sobrecargas

Nome Description
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em IDs de token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens.

EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
String

O texto a ser codificado.

maxTokenCount
Int32

O número máximo de tokens a serem codificados.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

normalizedText
String

Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.

charsConsumed
Int32

O comprimento do texto que abrange o máximo de tokens codificados.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Codifica o texto de entrada em IDs de tokens.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
String

O texto a ser codificado.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

maxTokenCount
Int32

O número máximo de tokens a serem codificados.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

normalizedText
String

Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.

charsConsumed
Int32

O comprimento do texto que abrange o máximo de tokens codificados.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Codifica o texto de entrada em IDs de token.

protected override Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overrides Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)

Parâmetros

text
String

O texto a ser codificado.

textSpan
ReadOnlySpan<Char>

O intervalo do texto a ser codificado, que será usado se for textnull.

settings
EncodeSettings

As configurações usadas para codificar o texto.

Retornos

Os resultados codificados que contêm a lista de IDs codificadas.

Aplica-se a

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Codifica o texto de entrada em IDs de tokens.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

A lista de IDs codificadas.

Aplica-se a