語言

CodeGenTokenizer 類別

定義

表示位元組對編碼模型。 實作描述的 CodeGen 分詞器 https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
繼承
CodeGenTokenizer
衍生

屬性

名稱 Description
AddBeginningOfSentence

取得指示是否在編碼中包含句子開頭符號的旗標。

AddEndOfSentence

取得指示是否包含句尾標記的旗標。

AddPrefixSpace

會取得指示是否在編碼文字前加入導引空格的旗標。

BeginningOfSentenceId

會拿到句尾的 Token ID。

BeginningOfSentenceToken

取得句子標記的開頭。

EndOfSentenceId

會拿到句尾的 Token ID。

EndOfSentenceToken

會拿到句尾的標記。

Normalizer

讓 Tokenizer 使用正規化器。

PreTokenizer

取得分幣器使用的預分組器。

SpecialTokens

獲得額外的代幣。

UnknownToken

未知的標記。

UnknownTokenId

取得未知的標記 ID。

Vocabulary

取得字典將標記映射到 ID。

方法

名稱 Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

CountTokens(String, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

Create(Stream, Stream, Boolean, Boolean, Boolean)

從給定的詞彙建立一個 CodeGen 分詞器,並合併串流。

Decode(IEnumerable<Int32>, Boolean, Boolean)

將給定的 id 解碼回字串。

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

Decode(IEnumerable<Int32>)

將給定的 id 解碼回字串。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

將輸入文字編碼為 Ids。

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 Id,最多可達標記數量。

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

(繼承來源 Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

將輸入文字編碼為 Ids。

EncodeToIds(String, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 Id,最多可達標記數量。

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

<param name=“text”> 要編碼的文字。</param> (繼承來源 Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為標記 ID。

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

將輸入文字編碼為物件,包含標記列表、標記 Id、標記偏移映射。

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

將輸入文字編碼為物件,包含標記列表、標記 Id、標記偏移映射。

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為一串 EncodedTokens 的列表。

EncodeToTokens(String, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

找出從文字末尾最大編碼容量的索引,且不超過標記限制。

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

找出從文字末尾最大編碼容量的索引,且不超過標記限制。

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)

適用於