BpeTokenizer.Create Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Przeciążenia
| Nazwa | Opis |
|---|---|
| Create(Stream, Stream) |
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu. |
| Create(String, String) |
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu. |
| Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu. |
| Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean) |
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu. |
Create(Stream, Stream)
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream);
static member Create : System.IO.Stream * System.IO.Stream -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream) As BpeTokenizer
Parametry
- vocabStream
- Stream
Strumień JSON zawierający słownik kluczy ciągów i ich identyfikatory.
- mergesStream
- Stream
Strumień zawierający listę par tokenów.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.
Dotyczy
Create(String, String)
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile);
static member Create : string * string -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String) As BpeTokenizer
Parametry
- vocabFile
- String
Ścieżka pliku JSON zawierająca słownik kluczy ciągów i ich identyfikatory.
- mergesFile
- String
Ścieżka pliku zawierająca listę par tokenów.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że plik słownictwa pochodzi od zaufanego dostawcy.
Dotyczy
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream? mergesStream, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : System.IO.Stream * System.IO.Stream * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parametry
- vocabStream
- Stream
Strumień JSON zawierający słownik kluczy ciągów i ich identyfikatory.
- mergesStream
- Stream
Strumień zawierający listę par tokenów.
- preTokenizer
- PreTokenizer
Pre-tokenizer do użycia.
- normalizer
- Normalizer
Normalizator do użycia.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Słownik mapuje specjalne tokeny na identyfikatory.
- unknownToken
- String
Nieznany token, który ma być używany przez model.
- continuingSubwordPrefix
- String
Prefiks do dołączania do jednostek wyrazów podrzędnych, które nie reprezentują początku wyrazu.
- endOfWordSuffix
- String
Sufiks dołączany do jednostek wyrazów podrzędnych reprezentujących koniec wyrazu.
- fuseUnknownTokens
- Boolean
Wskazuje, czy zezwalanie na łączenie wielu nieznanych tokenów.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa jest pozyskiwany od zaufanego dostawcy.
Dotyczy
Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
- Źródło:
- BPETokenizer.cs
Utwórz nowy obiekt tokenizatora Bpe do użycia na potrzeby kodowania tekstu.
public static Microsoft.ML.Tokenizers.BpeTokenizer Create(string vocabFile, string? mergesFile, Microsoft.ML.Tokenizers.PreTokenizer? preTokenizer = default, Microsoft.ML.Tokenizers.Normalizer? normalizer = default, System.Collections.Generic.IReadOnlyDictionary<string,int>? specialTokens = default, string? unknownToken = default, string? continuingSubwordPrefix = default, string? endOfWordSuffix = default, bool fuseUnknownTokens = false);
static member Create : string * string * Microsoft.ML.Tokenizers.PreTokenizer * Microsoft.ML.Tokenizers.Normalizer * System.Collections.Generic.IReadOnlyDictionary<string, int> * string * string * string * bool -> Microsoft.ML.Tokenizers.BpeTokenizer
Public Shared Function Create (vocabFile As String, mergesFile As String, Optional preTokenizer As PreTokenizer = Nothing, Optional normalizer As Normalizer = Nothing, Optional specialTokens As IReadOnlyDictionary(Of String, Integer) = Nothing, Optional unknownToken As String = Nothing, Optional continuingSubwordPrefix As String = Nothing, Optional endOfWordSuffix As String = Nothing, Optional fuseUnknownTokens As Boolean = false) As BpeTokenizer
Parametry
- vocabFile
- String
Ścieżka pliku JSON zawierająca słownik kluczy ciągów i ich identyfikatory.
- mergesFile
- String
Ścieżka pliku zawierająca listę par tokenów.
- preTokenizer
- PreTokenizer
Pre-tokenizer do użycia.
- normalizer
- Normalizer
Normalizator do użycia.
- specialTokens
- IReadOnlyDictionary<String,Int32>
Słownik mapuje specjalne tokeny na identyfikatory.
- unknownToken
- String
Nieznany token, który ma być używany przez model.
- continuingSubwordPrefix
- String
Prefiks do dołączania do jednostek wyrazów podrzędnych, które nie reprezentują początku wyrazu.
- endOfWordSuffix
- String
Sufiks dołączany do jednostek wyrazów podrzędnych reprezentujących koniec wyrazu.
- fuseUnknownTokens
- Boolean
Wskazuje, czy zezwalanie na łączenie wielu nieznanych tokenów.
Zwraca
Uwagi
Podczas tworzenia tokenizatora upewnij się, że plik słownictwa pochodzi od zaufanego dostawcy.