語言

BpeTokenizer 類別

定義

表示位元組對編碼模型。

public sealed class BpeTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type BpeTokenizer = class
    inherit Tokenizer
Public NotInheritable Class BpeTokenizer
Inherits Tokenizer
繼承
BpeTokenizer

屬性

名稱 Description
ContinuingSubwordPrefix

一個用於每個非詞首子詞的前綴

EndOfWordSuffix

一個可選的後綴用來描述詞尾及詞尾子詞

FuseUnknownTokens

是否允許多個未知標記被融合,取得或設定

Normalizer

讓 Tokenizer 使用正規化器。

PreTokenizer

取得分幣器使用的預分組器。

SpecialTokens

拿到特殊代幣。

UnknownToken

取得或設定未知標記。 遇到未知角色時使用的未知標記

Vocabulary

取得字典將標記映射到 ID。

方法

名稱 Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
Create(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(Stream, Stream)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(String, String, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

建立一個新的 Bpe 分子器物件來進行文字編碼。

Create(String, String)

建立一個新的 Bpe 分子器物件來進行文字編碼。

CreateAsync(Stream, Stream, PreTokenizer, Normalizer, IReadOnlyDictionary<String,Int32>, String, String, String, Boolean)

非同步建立一個新的 Bpe 分詞器物件,用於文字編碼。

Decode(IEnumerable<Int32>, Boolean)

將給定的 id 解碼回字串。

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

Decode(IEnumerable<Int32>)

將給定的 id 解碼回字串。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

(繼承來源 Tokenizer)
EncodeToIds(String, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

<param name=“text”> 要編碼的文字。</param> (繼承來源 Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)

適用於