AI說書 - 從0開始 - 291 | Tokenizer 重要性範例之展示 2 省思

發佈於三分鐘學AI (2)

2025/01/09 更新2025/01/09 發佈閱讀 3 分鐘

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。

在 AI說書 - 從0開始 - 290 | Tokenizer 重要性範例之展示 2 中，我們給了一個範例，當中包含未知的字詞，假設一個 AI 團隊發現了這個問題並嘗試用 Byte-Level 之 Byte-Pair Encoding (BPE) 來解決它，則會面臨以下問題：

unk 將被分解為單字片段，例如，我們最終可能會將 corporations 變成 corp + o + ra +tion + s，這些標記中的一個或多個很有可能在資料集中找到
unk 將成為一組由資料集中存在的標記表示的 Subwords，但不傳達原始標記的含義
Transformer 會訓練得很好，沒有人會注意到 unk 被打成碎片，訓練毫無意義
Transformer 可能會產生出色的結果並將其性能從 0.8 提高到 0.9
每個人都會鼓掌，直到專業用戶在危急情況下應用錯誤的結果，例如，在英語中，corp 可以表示 corporation 或 corporal，這可能會在 corp 和其他詞彙之間造成混亂和不良關聯

我們可以看到，社群媒體的標準可能足以使用 Transformer 來處理瑣碎的話題，但在現實的企業專案中，產生與資料集相符的預訓練 Tokenizer 將需要艱苦的工作，在現實生活中，資料集每天都會隨著使用者輸入而成長，使用者輸入成為模型資料集的一部分，應定期訓練和更新，確保品質控制的一種方法可以透過以下三個步驟：

使用 Byte-Level 之 Byte-Pair Encoding (BPE) 演算法訓練 Tokenizer
使用程式控制結果，例如我們將在本章的分析和控制 Token ID 對應的品質部分中建立程式
使用 Word2Vec 演算法訓練 Tokenizer，該演算法僅用於品質控制，然後解析資料集，找到 unk 分詞，並將其儲存在資料庫中，執行查詢以檢查是否缺少關鍵字

您可能會傾向於依賴 Transformer 對看不見的單字進行推理的能力，但是，我建議在具有關鍵決策的策略專案中執行多種品質控制方法。

#PromptEngineering

#chatgpt怎麼用

Learn AI 不 BI三分鐘學AI (2)AI從0開始-第十章

留言

留言分享你的想法！

Learn AI 不 BI

240會員

912內容數

這裡將提供： AI、Machine Learning、Deep Learning、Reinforcement Learning、Probabilistic Graphical Model的讀書筆記與演算法介紹，一起在未來AI的世界擁抱AI技術，不BI。

Learn AI 不 BI的其他內容

2025/01/29

AI說書 - 從0開始 - 308 | 第十章額外閱讀

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。在本章中，我們測量了 Tokenization 對 Transformer 模型後續層的影響，Transformer 模型只能關注堆疊的嵌入層和位置編碼子層中的 Tok

2025/01/29

AI說書 - 從0開始 - 308 | 第十章額外閱讀

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。在本章中，我們測量了 Tokenization 對 Transformer 模型後續層的影響，Transformer 模型只能關注堆疊的嵌入層和位置編碼子層中的 Tok

2025/01/28

AI說書 - 從0開始 - 307 | Token ID 映射品質管控

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。想要控管 Token ID 映射的品質，有鑑於此，先定義，先定義 Tokenizer： model_name = 'bert-base-uncased' token

2025/01/28

AI說書 - 從0開始 - 307 | Token ID 映射品質管控

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。想要控管 Token ID 映射的品質，有鑑於此，先定義，先定義 Tokenizer： model_name = 'bert-base-uncased' token

2025/01/27

AI說書 - 從0開始 - 306 | Token ID 映射顯示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 304 | WordPiece Tokenization 介紹與偵測講 WordPiece Tokenizer，而 AI說書 - 從

2025/01/27

AI說書 - 從0開始 - 306 | Token ID 映射顯示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 304 | WordPiece Tokenization 介紹與偵測講 WordPiece Tokenizer，而 AI說書 - 從

你可能也想看

雙11必看！我在蝦皮買過最划算的商品＋購物攻略全公開

想在蝦皮雙11買到最划算？這篇文章將分享作者精選的蝦皮高CP值商品，包含HERAN禾聯冷氣、HITACHI日立冰箱、DJI無線麥克風、FUJIFILM拍立得，並提供蝦皮雙11優惠券領取教學、省錢技巧，以及蝦皮分潤計畫介紹，讓你買得開心、省得多！

#雙11#分享#蝦皮

2025/11/05

雙11必看！我在蝦皮買過最划算的商品＋購物攻略全公開

想在蝦皮雙11買到最划算？這篇文章將分享作者精選的蝦皮高CP值商品，包含HERAN禾聯冷氣、HITACHI日立冰箱、DJI無線麥克風、FUJIFILM拍立得，並提供蝦皮雙11優惠券領取教學、省錢技巧，以及蝦皮分潤計畫介紹，讓你買得開心、省得多！

#雙11#分享#蝦皮

2025/11/05

涵流筆記 HanFlow

蝦皮1111購物節攻略：全站0元起免運！我推薦的高CP值購物清單與省錢秘訣

2025 蝦皮 1111 購物節又來了！分享三大必買原因：全站 $0 起免運、多重優惠疊加、便利取貨。此外，推薦兩款高 CP 值的即食拉麵（無印良品即食迷你拉麵、維力迷你麵野菜拉麵），並分享如何透過「蝦皮分潤計畫」放大效益，開心購物之餘還能獲得額外收益！

#蝦皮分潤計畫#蝦皮1111#蝦皮免運

2025/11/05

涵流筆記 HanFlow

蝦皮1111購物節攻略：全站0元起免運！我推薦的高CP值購物清單與省錢秘訣

2025 蝦皮 1111 購物節又來了！分享三大必買原因：全站 $0 起免運、多重優惠疊加、便利取貨。此外，推薦兩款高 CP 值的即食拉麵（無印良品即食迷你拉麵、維力迷你麵野菜拉麵），並分享如何透過「蝦皮分潤計畫」放大效益，開心購物之餘還能獲得額外收益！

#蝦皮分潤計畫#蝦皮1111#蝦皮免運

2025/11/05

Learn AI 不 BI

AI說書 - 從0開始 - 321 | Embedding 後詞彙與 ID 映射

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/10

Learn AI 不 BI

AI說書 - 從0開始 - 321 | Embedding 後詞彙與 ID 映射

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/10

Learn AI 不 BI

AI說書 - 從0開始 - 320 | Embedding 後詞彙相似度計算

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/09

Learn AI 不 BI

AI說書 - 從0開始 - 320 | Embedding 後詞彙相似度計算

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/09

Learn AI 不 BI

AI說書 - 從0開始 - 316 | Tokenization 後基本資訊窺探與 Embedding 訓練

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/04

Learn AI 不 BI

AI說書 - 從0開始 - 316 | Tokenization 後基本資訊窺探與 Embedding 訓練

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧目前手上有的素材：載入文本並執行 Tokenization：AI說書 - 從0開始 - 314 | 載入文本並執行 Tokenization 文本處理以降低

#AI#ai#PromptEngineering

2025/02/04

Learn AI 不 BI

AI說書 - 從0開始 - 306 | Token ID 映射顯示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 304 | WordPiece Tokenization 介紹與偵測講 WordPiece Tokenizer，而 AI說書 - 從

#AI#ai#PromptEngineering

2025/01/27

Learn AI 不 BI

AI說書 - 從0開始 - 306 | Token ID 映射顯示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 304 | WordPiece Tokenization 介紹與偵測講 WordPiece Tokenizer，而 AI說書 - 從

#AI#ai#PromptEngineering

2025/01/27

Learn AI 不 BI

AI說書 - 從0開始 - 298 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝、AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示、AI說書 -

#AI#ai#PromptEngineering

2025/01/17

Learn AI 不 BI

AI說書 - 從0開始 - 298 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝、AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示、AI說書 -

#AI#ai#PromptEngineering

2025/01/17

Learn AI 不 BI

AI說書 - 從0開始 - 297 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝及 AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示，我們繼續

#AI#ai#PromptEngineering

2025/01/16

Learn AI 不 BI

AI說書 - 從0開始 - 297 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝及 AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示，我們繼續

#AI#ai#PromptEngineering

2025/01/16

Learn AI 不 BI

AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝安裝的各種 Tokenizer，我們來展示其用處： Sentence Toke

#AI#ai#PromptEngineering

2025/01/15

Learn AI 不 BI

AI說書 - 從0開始 - 296 | 各 Tokenizer 之展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 295 | 各 Tokenizer 之優勢與安裝安裝的各種 Tokenizer，我們來展示其用處： Sentence Toke

#AI#ai#PromptEngineering

2025/01/15

Learn AI 不 BI

AI說書 - 從0開始 - 294 | Tokenizer 重要性範例之展示 6

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。替換生僻字詞本身就是一個項目，這項工作是為特定任務和項目保留的，例如，假設公司預算可以支付建立航空知識庫的成本，在這種情況下，值得花時間查詢 Tokenized Dir

#AI#ai#PromptEngineering

2025/01/13

Learn AI 不 BI

AI說書 - 從0開始 - 294 | Tokenizer 重要性範例之展示 6

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。替換生僻字詞本身就是一個項目，這項工作是為特定任務和項目保留的，例如，假設公司預算可以支付建立航空知識庫的成本，在這種情況下，值得花時間查詢 Tokenized Dir

#AI#ai#PromptEngineering

2025/01/13

Learn AI 不 BI

AI說書 - 從0開始 - 288 | Tokenizer 重要性範例之 Embedding 訓練

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 287 | Tokenizer 重要性範例之資料準備，接著來執行 Tokenization： sample = open("text

#AI#ai#PromptEngineering

2025/01/06

Learn AI 不 BI

AI說書 - 從0開始 - 288 | Tokenizer 重要性範例之 Embedding 訓練

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。延續 AI說書 - 從0開始 - 287 | Tokenizer 重要性範例之資料準備，接著來執行 Tokenization： sample = open("text

#AI#ai#PromptEngineering

2025/01/06

Learn AI 不 BI

AI說書 - 從0開始 - 167 | Tokenizer 使用方式

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。整理目前手上有的素材：準備資料集：AI說書 - 從0開始 - 162 | 準備Pretrain模型需要的資料準備必備函數庫：AI說書 - 從0開始 - 163

#AI#ai#PromptEngineering

2024/09/05

Learn AI 不 BI

AI說書 - 從0開始 - 167 | Tokenizer 使用方式

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。整理目前手上有的素材：準備資料集：AI說書 - 從0開始 - 162 | 準備Pretrain模型需要的資料準備必備函數庫：AI說書 - 從0開始 - 163

#AI#ai#PromptEngineering

2024/09/05

追蹤感興趣的內容從 Google News 追蹤更多 vocus 的最新精選內容追蹤 Google News