CodeGenTokenizer.GetIndexByTokenCount Método
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Sobrecargas
| Nome | Description |
|---|---|
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. |
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.
public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parâmetros
- text
- ReadOnlySpan<Char>
O texto a ser codificado.
- maxTokenCount
- Int32
A contagem máxima de tokens para limitar a capacidade de codificação.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto ou se normalizedText a normalização estiver habilitada.
Aplica-se a
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.
protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer
Parâmetros
- text
- String
O texto a ser codificado.
- textSpan
- ReadOnlySpan<Char>
O intervalo do texto a ser codificado, que será usado se for textnull.
- settings
- EncodeSettings
As configurações usadas para codificar o texto.
- fromEnd
- Boolean
Indique se o índice deve ser localizado no final do texto.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada ou <paramRef name="settings"></paramRef> tiver ConsiderNormalizationfalse, isso será definido como <paramRef name="text"></paramRef> em sua forma normalizada; caso contrário, esse valor será definido como null.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Se <paramRef name="fromEnd"></paramRef> for false, ele representará o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto de entrada ou se normalizedText a normalização estiver habilitada.
Se <paramRef name="fromEnd"></paramRef> for true, ele representará o índice do primeiro caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será o comprimento do texto; por outro lado, se todos os tokens se ajustarem, o resultado será zero.
Aplica-se a
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
- Origem:
- CodeGenTokenizer.cs
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.
public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer
Parâmetros
- text
- String
O texto a ser codificado.
- maxTokenCount
- Int32
A contagem máxima de tokens para limitar a capacidade de codificação.
- addPrefixSpace
- Boolean
Indique se deve incluir um espaço à esquerda antes de codificar o texto.
- addBeginningOfSentence
- Boolean
Indique se deve incluir o início do token de sentença na codificação.
- addEndOfSentence
- Boolean
Indique se o token de fim de frase deve ser incluído na codificação.
- normalizedText
- String
Se a normalização do tokenizer estiver habilitada, o texto de entrada será representado no formulário de normalização; caso contrário, ele será nulo.
- tokenCount
- Int32
A contagem de tokens pode ser gerada, que deve ser menor que a contagem máxima de tokens.
- considerPreTokenization
- Boolean
Indique se deve considerar a pré-tokenização antes da tokenização.
- considerNormalization
- Boolean
Indique se deve considerar a normalização antes da tokenização.
Retornos
O índice da capacidade máxima de codificação dentro do texto processado sem ultrapassar o limite de token.
Ele representa o índice imediatamente após o último caractere a ser incluído. Nos casos em que nenhum token se ajustar, o resultado será 0; por outro lado, se todos os tokens se ajustarem, o resultado será o comprimento do texto ou se normalizedText a normalização estiver habilitada.