Tokenizer.GetIndexByTokenCount Método
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Sobrecargas
| Nome | Description |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : ReadOnlySpan<char> * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerPreTokenization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.
Aplica-se a
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.
public int GetIndexByTokenCount(string text, int maxTokenCount, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
member this.GetIndexByTokenCount : string * int * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parâmetros
- text
- String
O texto a ser codificado.
- maxTokenCount
- Int32
O número máximo de tokens a serem codificados.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="considerNormalization"></paramRef> for false, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.
Aplica-se a
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
- Origem:
- Tokenizer.cs
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.
protected virtual int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
abstract member GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overridable Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parâmetros
- text
- String
O texto a ser codificado.
- textSpan
- ReadOnlySpan<Char>
O intervalo do texto a ser codificado, que será usado se for textnull.
- settings
- EncodeSettings
As configurações usadas para codificar o texto.
- fromEnd
- Boolean
Indique se o índice deve ser localizado no final do texto.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="settings"></paramRef> tiver ConsiderNormalizationfalse, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Se <paramRef name="fromEnd"></paramRef> for false, ele representará o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.
Se <paramRef name="fromEnd"></paramRef> for true, ele representará o índice do primeiro caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será o comprimento do texto; por outro lado, se todos os tokens se ajustarem, o resultado será zero.
Comentários
Os tipos derivados Tokenizer podem substituir essa implementação para fornecer uma implementação mais eficiente. Por predefinição, utiliza EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings).