AI說書 - 從0開始 - 130 | Masked Language Modeling 訓練

2024/08/13 更新2024/08/13 發佈閱讀 2 分鐘

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。

回顧 AI說書 - 從0開始 - 129 中說，Bidirectional Encoder Representations from Transformers (BERT) 的訓練分為兩種，分別為：

Masked Language Modeling (MLM)
Next Sentence Prediction (NSP)

今天來介紹 Masked Language Modeling (MLM) 的核心想法，一樣舉句子「The cat sat on it because it was a nice rug」為例，在 Decoder 模式中，當我預測「it」這個字的時候，我需要把它後面的字掩蓋起來，因為不可以偷看未來的答案，句子會變成「The cat sat on it <masked sequence>」，但是 BERT 的 Encoder 也會做掩蓋這動作，差別為它是隨機掩蓋，亦即句子有可能變成「The cat sat on it [MASK] it was a nice rug」

上述思想其實就是以克漏字為靈感，在任意段落中進行挖空，模型利用挖空的前後文來預測挖空部分應該填入的文字，實際運行上就是把最後一層的 Encoder 輸出向量餵進去一個 Classification Layer 並且轉換成與字典一樣大小的維度，再經過 Softmax 去看哪個維度的詞彙機率值最高，就取那個字為預測字，最後將預測結果與正確答案比對計算Cross Entropy Loss，將模型進行更新，圖示化呈現為：

這邊會有一個問題是 Pre-Train 和 Fine-Tune 的不匹配，因為在 Fine-Tune 時，並不會像 Pre-Train 有 [MASK] 這樣的東西出現，此時，作者加入一些雜訊 (防止 Overfitting) 的概念來解決這樣的問題，其中 80% 就維持原先的 [MASK]，有 10% 改成用隨機的文字取代，最後 10% 則是維持原先沒有被 [MASK] 的 Token，例子如下：

10% 維持不變：The cat sat on it [because] it was a nice rug
10% 變成隨機：The cat sat on it [often] it was a nice rug
80% 維持掩蓋：The cat sat on it [Mask] it was a nice rug

Learn AI 不 BI三分鐘學AIAI從0開始-第五章

留言

Learn AI 不 BI

249會員

1.1K內容數

這裡將提供： AI、Machine Learning、Deep Learning、Reinforcement Learning、Probabilistic Graphical Model的讀書筆記與演算法介紹，一起在未來AI的世界擁抱AI技術，不BI。

Learn AI 不 BI的其他內容

2024/08/30

AI說書 - 從0開始 - 156 | 第五章額外閱讀

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。從 AI說書 - 從0開始 - 125 到 AI說書 - 從0開始 - 155 | 文法判斷介面成果展示，我們完成書籍：Transformers for Natural

2024/08/30

AI說書 - 從0開始 - 156 | 第五章額外閱讀

2024/08/30

AI說書 - 從0開始 - 155 | 文法判斷介面成果展示

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧一下目前手上有的素材：訓練的必要模組安裝：AI說書 - 從0開始 - 135 載入資料集：AI說書 - 從0開始 - 136 資料集窺探：AI說書 - 從0

2024/08/30

AI說書 - 從0開始 - 155 | 文法判斷介面成果展示

2024/08/29

AI說書 - 從0開始 - 154 | 製作預測文法正確與否的聊天介面

2024/08/29

AI說書 - 從0開始 - 154 | 製作預測文法正確與否的聊天介面

看更多

你可能也想看

釀電影，啜一口電影的美好。

《傳奇：帕拉贊諾夫的十段殘篇》：以流亡書寫帕拉贊諾夫的政治寓言

賽勒布倫尼科夫以流亡處境回望蘇聯電影導演帕拉贊諾夫的舞台作品，以十段寓言式殘篇，重新拼貼記憶、暴力與美學，並將審查、政治犯、戰爭陰影與「形式即政治」的劇場傳統推到台前。本文聚焦於《傳奇：帕拉贊諾夫的十段殘篇》的舞台美術、音樂與多重扮演策略，嘗試解析極權底下不可言說之事，將如何成為可被觀看的公共發聲。

#釀電影#釀評論#藝術評論

2026/01/14

釀電影，啜一口電影的美好。

《傳奇：帕拉贊諾夫的十段殘篇》：以流亡書寫帕拉贊諾夫的政治寓言

#釀電影#釀評論#藝術評論

2026/01/14

趙鐸的沙龍

柏林劇團《三便士歌劇》：善讓人嚮往，惡卻更加迷人──布萊希特的疏離與慾望

柏林劇團在 2026 北藝嚴選，再次帶來由布萊希特改編的經典劇目《三便士歌劇》（The Threepenny Opera），導演巴里・柯斯基以舞台結構與舞台調度，重新向「疏離」進行提問。本文將從觀眾慾望作為戲劇內核，藉由沉浸與疏離的辯證，解析此作如何再次照見觀眾自身的位置。

#2026北藝嚴選#臺北表演藝術中心#北藝嚴選

2026/01/14

趙鐸的沙龍

柏林劇團《三便士歌劇》：善讓人嚮往，惡卻更加迷人──布萊希特的疏離與慾望

#2026北藝嚴選#臺北表演藝術中心#北藝嚴選

2026/01/14

花神沒有咖啡館的沙龍

《海妲．蓋柏樂》：晃晃跨幅町直球對決經典，解構現代女性的困頓與慾望

本文深入解析臺灣劇團「晃晃跨幅町」對易卜生經典劇作《海妲．蓋柏樂》的詮釋，從劇本歷史、聲響與舞臺設計，到演員的主體創作方法，探討此版本如何讓經典劇作在當代劇場語境下煥發新生，滿足現代觀眾的觀看慾望。

#2026北藝嚴選#北藝嚴選#臺北表演藝術中心

2026/01/14

花神沒有咖啡館的沙龍

《海妲．蓋柏樂》：晃晃跨幅町直球對決經典，解構現代女性的困頓與慾望

#2026北藝嚴選#北藝嚴選#臺北表演藝術中心

2026/01/14

涵柳的沙龍

《轉轉生 Re:INCARNATION》：從身體與服裝看見奈及利亞的重生

《轉轉生》為奈及利亞編舞家庫德斯．奧尼奎庫與 Q 舞團創作的當代舞蹈作品，融合舞蹈、音樂、時尚和視覺藝術，透過身體、服裝與群舞結構，回應殖民歷史、城市經驗與祖靈記憶的交錯。本文將從服裝設計、身體語彙與「輪迴」的「誕生—死亡—重生」結構出發，分析《轉轉生》如何以當代目光，形塑去殖民視角的奈及利亞歷史。

#2026北藝嚴選#北藝嚴選#臺北表演藝術中心

2026/01/14

涵柳的沙龍

《轉轉生 Re:INCARNATION》：從身體與服裝看見奈及利亞的重生

#2026北藝嚴選#北藝嚴選#臺北表演藝術中心

2026/01/14