Język

CodeGenTokenizer.EncodeToIds Metoda

Definicja

Przeciążenia

Nazwa Opis
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametry

text
String

Tekst do zakodowania.

maxTokenCount
Int32

Maksymalna liczba tokenów do zakodowania.

addPrefixSpace
Boolean

Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

addBeginningOfSentence
Boolean

Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.

addEndOfSentence
Boolean

Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.

normalizedText
String

Jeśli normalizacja tokenizatora jest włączona, tekst wejściowy będzie reprezentowany w postaci normalizacji; w przeciwnym razie będzie mieć wartość null.

charsConsumed
Int32

Długość tekstu, który obejmuje maksymalne zakodowane tokeny.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Lista zakodowanych identyfikatorów.

Dotyczy

EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs

Koduje tekst wejściowy do identyfikatorów tokenów.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(string text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : string * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As String, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametry

text
String

Tekst do zakodowania.

addPrefixSpace
Boolean

Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

addBeginningOfSentence
Boolean

Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.

addEndOfSentence
Boolean

Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Lista zakodowanych identyfikatorów.

Dotyczy

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int charsConsumed, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef charsConsumed As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametry

text
ReadOnlySpan<Char>

Tekst do zakodowania.

maxTokenCount
Int32

Maksymalna liczba tokenów do zakodowania.

addPrefixSpace
Boolean

Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

addBeginningOfSentence
Boolean

Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.

addEndOfSentence
Boolean

Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.

normalizedText
String

Jeśli normalizacja tokenizatora jest włączona, tekst wejściowy będzie reprezentowany w postaci normalizacji; w przeciwnym razie będzie mieć wartość null.

charsConsumed
Int32

Długość tekstu, który obejmuje maksymalne zakodowane tokeny.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Lista zakodowanych identyfikatorów.

Dotyczy

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs

Koduje tekst wejściowy do identyfikatorów tokenu.

protected override Microsoft.ML.Tokenizers.EncodeResults<int> EncodeToIds(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings);
override this.EncodeToIds : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings -> Microsoft.ML.Tokenizers.EncodeResults<int>
Protected Overrides Function EncodeToIds (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings) As EncodeResults(Of Integer)

Parametry

text
String

Tekst do zakodowania.

textSpan
ReadOnlySpan<Char>

Zakres tekstu do zakodowania, który będzie używany, jeśli element text ma wartość null.

settings
EncodeSettings

Ustawienia używane do kodowania tekstu.

Zwraca

Zakodowane wyniki zawierające listę zakodowanych identyfikatorów.

Dotyczy

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs
Źródło:
CodeGenTokenizer.cs

Koduje tekst wejściowy do identyfikatorów tokenów.

public System.Collections.Generic.IReadOnlyList<int> EncodeToIds(ReadOnlySpan<char> text, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, bool considerPreTokenization = true, bool considerNormalization = true);
override this.EncodeToIds : ReadOnlySpan<char> * bool * bool * bool * bool * bool -> System.Collections.Generic.IReadOnlyList<int>
Public Function EncodeToIds (text As ReadOnlySpan(Of Char), addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As IReadOnlyList(Of Integer)

Parametry

text
ReadOnlySpan<Char>

Tekst do zakodowania.

addPrefixSpace
Boolean

Określ, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

addBeginningOfSentence
Boolean

Określ, czy należy uwzględnić początek tokenu zdania w kodowaniu.

addEndOfSentence
Boolean

Określ, czy należy uwzględnić koniec tokenu zdania w kodowaniu.

considerPreTokenization
Boolean

Określ, czy należy rozważyć wstępne tokenizację przed tokenizacją.

considerNormalization
Boolean

Określ, czy należy rozważyć normalizację przed tokenizacją.

Zwraca

Lista zakodowanych identyfikatorów.

Dotyczy