語言

Tokenizer 類別

定義

提供分詞器抽象化,使文字能編碼成標記,並將標記 ID 解碼回文字。

public abstract class Tokenizer
public class Tokenizer
type Tokenizer = class
Public MustInherit Class Tokenizer
Public Class Tokenizer
繼承
Tokenizer
衍生

建構函式

名稱 Description
Tokenizer()

初始化 Tokenizer 類別的新執行個體。

Tokenizer(Model, PreTokenizer, Normalizer)

建立一個新的 Tokenizer 物件。

屬性

名稱 Description
Decoder

取得或設定解碼器被分詞器使用。

Model

讓模型被代幣化器使用。

Normalizer

讓 Tokenizer 使用正規化器。

PreTokenizer

取得分幣器使用的預分組器。

方法

名稱 Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(String, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

Decode(IEnumerable<Int32>, Boolean)

將給定的 id 解碼回字串。

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

Decode(IEnumerable<Int32>)

將給定的 id 解碼回字串。

Decode(Int32, Boolean)

將 ID 解碼為映射的標記。

Encode(String)

將輸入文字編碼為物件,包含標記列表、標記 Id、標記偏移映射。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

EncodeToIds(String, Boolean, Boolean)

將輸入文字編碼為標記 ID。

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

<param name=“text”> 要編碼的文字。</param>
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為標記 ID。

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為一串 EncodedTokens 的列表。

EncodeToTokens(String, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

TrainFromFiles(Trainer, ReportProgress, String[])

用輸入檔案訓練分詞器模型。

適用於