Idioma

CodeGenTokenizer.GetIndexByTokenCount Método

Definição

Sobrecargas

Nome Description
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
ReadOnlySpan<Char>

O texto a ser codificado.

maxTokenCount
Int32

A contagem máxima de tokens para limitar a capacidade de codificação.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

normalizedText
String

Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto ou se normalizedText a normalização estiver habilitada.

Aplica-se a

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parâmetros

text
String

O texto a ser codificado.

textSpan
ReadOnlySpan<Char>

O intervalo do texto a ser codificado, que será usado se for textnull.

settings
EncodeSettings

As configurações usadas para codificar o texto.

fromEnd
Boolean

Indique se o índice deve ser localizado no final do texto.

normalizedText
String

Se a normalização do tokenizer estiver habilitada ou <paramRef name="settings"></paramRef> tiver ConsiderNormalizationfalse, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Se <paramRef name="fromEnd"></paramRef> for false, ele representará o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada. Se <paramRef name="fromEnd"></paramRef> for true, ele representará o índice do primeiro caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será o comprimento do texto; por outro lado, se todos os tokens se ajustarem, o resultado será zero.

Aplica-se a

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs
Origem:
CodeGenTokenizer.cs

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parâmetros

text
String

O texto a ser codificado.

maxTokenCount
Int32

A contagem máxima de tokens para limitar a capacidade de codificação.

addPrefixSpace
Boolean

Indique se deve incluir um espaço à esquerda antes de codificar o texto.

addBeginningOfSentence
Boolean

Indique se deve incluir o início do token de sentença na codificação.

addEndOfSentence
Boolean

Indique se o token de fim de frase deve ser incluído na codificação.

normalizedText
String

Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.

tokenCount
Int32

A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.

considerPreTokenization
Boolean

Indique se deve considerar a pré-tokenização antes da tokenização.

considerNormalization
Boolean

Indique se deve considerar a normalização antes da tokenização.

Retornos

O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token. Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto ou se normalizedText a normalização estiver habilitada.

Aplica-se a