Idioma

Tokenizer.GetIndexByTokenCount Método

Definição

Sobrecargas

Nome Description
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

maxTokenCount
Int32

O número máximo de tokens a serem codificados.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerPreTokenization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.

Aplica-se a

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
String

O texto a ser codificado.

maxTokenCount
Int32

O número máximo de tokens a serem codificados.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.

Aplica-se a

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Origem:
Tokenizer.cs
Origem:
Tokenizer.cs
Origem:
Tokenizer.cs

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parâmetros

text
String

O texto a ser codificado.

textSpan
ReadOnlySpan<Char>

O intervalo do texto a ser codificado, que será usado se for textnull.

settings
EncodeSettings

As configurações usadas para codificar o texto.

fromEnd
Boolean

Indique se o índice deve ser localizado no final do texto.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="settings"></paramRef> tiver ConsiderNormalizationfalse, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Se <paramRef name="fromEnd"></paramRef> for false, ele representará o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada. Se <paramRef name="fromEnd"></paramRef> for true, ele representará o índice do primeiro caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será o comprimento do texto; por outro lado, se todos os tokens se ajustarem, o resultado será zero.

Comentários

Os tipos derivados Tokenizer podem substituir essa implementação para fornecer uma implementação mais eficiente. Por predefinição, utiliza EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).

Aplica-se a