Idioma

CodeGenTokenizer.CountTokens Método

Definição

Sobrecargas

Nome Description
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Obtenha o número de tokens aos quais o texto de entrada será codificado.

protected override int CountTokens(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.CountTokens : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> int
Protected Overrides Function CountTokens (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As Integer

Parâmetros

text
String

O texto a ser codificado.

textSpan
ReadOnlySpan<Char>

O intervalo do texto a ser codificado, que será usado se for textnull.

settings
EncodeSettings

As configurações usadas para codificar o texto.

Retornos

O número de IDs de token às quais o texto de entrada será codificado.

Aplica-se a

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Obtenha o número de tokens aos quais o texto de entrada será codificado.

public int CountTokens(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O número de IDs de tokens às quais o texto de entrada será codificado.

Aplica-se a

CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Obtenha o número de tokens aos quais o texto de entrada será codificado.

public int CountTokens(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.CountTokens : string * bool * bool * bool * bool * bool -> int
Public Function CountTokens (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
String

O texto a ser codificado.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O número de IDs de tokens às quais o texto de entrada será codificado.

Aplica-se a