EnglishRobertaTokenizer Classe
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Rappresentare il modello di codifica della coppia di byte.
public sealed class EnglishRobertaTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type EnglishRobertaTokenizer = class
inherit Tokenizer
Public NotInheritable Class EnglishRobertaTokenizer
Inherits Tokenizer
- Ereditarietà
Proprietà
| Nome | Descrizione |
|---|---|
| FilterUnsupportedChars |
Indicare se si desidera filtrare i caratteri non supportati durante la decodifica. |
| Normalizer |
Ottiene il normalizer in uso dal tokenizer. |
| PadIndex |
Ottiene l'indice del simbolo del riquadro all'interno dell'elenco dei simboli. |
| PreTokenizer |
Ottiene il preTokenizer utilizzato dal tokenizer. |
| SymbolsCount |
Ottiene la lunghezza dell'elenco dei simboli. |
| Vocabulary |
Ottiene i token di mapping del dizionario agli ID. |
Metodi
| Nome | Descrizione |
|---|---|
| AddMaskSymbol(String) |
Aggiungere il simbolo della maschera all'elenco dei simboli. |
| ConvertIdsToOccurrenceRanks(IReadOnlyList<Int32>) |
Convertire un elenco di ID token in classifica delle occorrenze più alte. |
| ConvertIdsToOccurrenceValues(IReadOnlyList<Int32>) |
Convertire un elenco di ID token in valori di occorrenza più alti. |
| ConvertOccurrenceRanksToIds(IReadOnlyList<Int32>) |
Convertire un elenco di classificazioni delle occorrenze più alte nell'elenco di ID token . |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| Create(Stream, Stream, Stream, PreTokenizer, Normalizer, Boolean) |
Creare l'oggetto modello del tokenizer da usare con il modello Inglese Robert. |
| Create(Stream, Stream, Stream) |
Creare l'oggetto modello del tokenizer da usare con il modello Inglese Robert. |
| Create(String, String, String, PreTokenizer, Normalizer, Boolean) |
Creare l'oggetto modello del tokenizer da usare con il modello Inglese Robert. |
| Create(String, String, String) |
Creare l'oggetto modello del tokenizer da usare con il modello Inglese Robert. |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo |
| Decode(IEnumerable<Int32>) |
Decodificare gli ID specificati, tornare a un valore String. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. (Ereditato da Tokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codifica il testo di input in ID token. (Ereditato da Tokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token fino al numero massimo di token. <param name="text">Testo da codificare.</param> (Ereditato da Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in ID token. (Ereditato da Tokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| IsSupportedChar(Char) |
Controllare se il carattere è supportato dal modello del tokenizer. |