AI說書 - 從0開始 - 108 | 資料清洗總匯

更新於 2024/07/30發佈於 2024/07/30閱讀時間約 3 分鐘

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。

總結一下目前有的素材：

AI說書 - 從0開始 - 103：資料集載入
AI說書 - 從0開始 - 104：定義資料清洗的函數
AI說書 - 從0開始 - 105：資料集的資料進行資料清洗
AI說書 - 從0開始 - 106：定義空白表單、詞彙計數器的函數 (排除頻率低的詞彙)
AI說書 - 從0開始 - 107：定義將沒看過的詞彙轉為 'unk' 的函數

現在我們將這些素材匯集在一起：

# Load English dataset
filename = 'English.pkl'
lines = load_clean_sentences(filename)

# Calculate vocabulary
vocab = to_vocab(lines)
print('English Vocabulary: %d' % len(vocab))

# Reduce vocabulary
vocab = trim_vocab(vocab, 5)
print('New English Vocabulary: %d' % len(vocab))

# Mark out of vocabulary words
lines = update_dataset(lines, vocab)

# Save updated dataset
filename = 'english_vocab.pkl'
save_clean_sentences(lines, filename)

# Spot check
for i in range(20):
	print("line", i, ":", lines[i])

運行結果為：

以及：

上述是針對英文資料集的作法，以下針對法文資料集重做一遍：

# Load French dataset
filename = 'French.pkl'
lines = load_clean_sentences(filename)

# Calculate vocabulary
vocab = to_vocab(lines)
print('French Vocabulary: %d' % len(vocab))

# Reduce vocabulary
vocab = trim_vocab(vocab, 5)
print('New French Vocabulary: %d' % len(vocab))

# Mark out of vocabulary words
lines = update_dataset(lines, vocab)

# Save updated dataset
filename = 'french_vocab.pkl'
save_clean_sentences(lines, filename)

# Spot check
for i in range(20):
	print("line", i, ":", lines[i])

運行結果為：

以及：

Learn AI 不 BI三分鐘學AIAI從0開始-第四章

Learn AI 不 BI

201會員

516內容數

這裡將提供： AI、Machine Learning、Deep Learning、Reinforcement Learning、Probabilistic Graphical Model的讀書筆記與演算法介紹，一起在未來AI的世界擁抱AI技術，不BI。

留言

留言分享你的想法！

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

‌

‌
‌

Learn AI 不 BI 的其他內容

AI說書 - Prompt Engineering - 63 | 引導式對話

我們人類和ChatGPT的對話技巧也是需要學習的，有鑑於此，我想要一天分享一點「和ChatGPT對話的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。如果您對自動模擬中的細節不滿意，您可以使用一系列引導 Prompt 將對話引導至您喜歡的方式，以下範例示

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 107 | AI怎麼處理沒看過的字

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。總結一下目前有的素材： AI說書 - 從0開始 - 103：資料集載入 AI說書 - 從0開始 - 104：定義資料清洗的函數 AI說書 - 從0開始 - 105

#AI #ai #PromptEngineering

AI說書 - Prompt Engineering - 62 | Scenario Based Prompt 範例回應

我們人類和ChatGPT的對話技巧也是需要學習的，有鑑於此，我想要一天分享一點「和ChatGPT對話的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。回顧我們在 AI說書 - Prompt Engineering - 61 | Scenario Base

#AI #ai #PromptEngineering

AI說書 - Prompt Engineering - 61 | Scenario Based Prompt 撰寫範例

我們人類和ChatGPT的對話技巧也是需要學習的，有鑑於此，我想要一天分享一點「和ChatGPT對話的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。今天我們以 Scenario Based 模擬為基礎，來進行 Prompt 撰寫模擬戰略討論

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 106 | 低頻率詞彙篩除方法

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們從 AI說書 - 從0開始 - 103 至 AI說書 - 從0開始 - 105 的努力，已經完成資料集前處理，現在需要定義一個函數來加載這些清理過的數據集，並在預處

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 105 | AI 資料準備

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經有資料集在 AI說書 - 從0開始 - 103 ，必要的清理函數在 AI說書 - 從0開始 - 104 ，現在把它們湊在一起，如下： # load Eng

#AI #ai #PromptEngineering

AI說書 - Prompt Engineering - 63 | 引導式對話

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 107 | AI怎麼處理沒看過的字

#AI #ai #PromptEngineering

AI說書 - Prompt Engineering - 62 | Scenario Based Prompt 範例回應

#AI #ai #PromptEngineering

AI說書 - Prompt Engineering - 61 | Scenario Based Prompt 撰寫範例

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 106 | 低頻率詞彙篩除方法

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 105 | AI 資料準備

#AI #ai #PromptEngineering

你可能也想看

最近AI的産圖越來越多，是時候開始整理了，隨機生成的廢圖基本上都清除了，剩下一堆感覺不差的挑一挑，只是數量有點多。

廣告雜誌

2024/07/31

從資料清洗到 RAG，大型語言模型的必需品，做出專屬企業的 AI 知識庫！

在當今快速變化的數位時代，企業面臨著前所未有的數據處理需求。為了應對這些挑戰，企業紛紛建立自己的大型語言模型（LLM），利用大量數據進行訓練，讓模型能夠理解並生成自然語言，從而實現人機協作，優化業務流程並提升客戶體驗。

本文介紹了AI助手在數據收集和訓練過程中的工作原理和不斷進步的過程。關注的內容包括從公開的網絡資源、書籍、文章等渠道收集數據，數據的清洗和結構化處理，知識庫的增量更新以及訓練算法和模型的優化。如果大家對AI助手的發展還有任何其他感興趣的話題或建議，歡迎隨時告訴我們，讓我們共同探索，攜手進步。

#數據 #學習 #模型

Darren的沙龍

2024/07/05

解密 AI 與資料科學 (一) : AI 開發鏈, 跨領域溝通 & 最具未來性的職業

本文談及資料科學的領域與分工。首先是建造一個AI的研發流程，資料收集到 AI 模型訓練的過程，AI經歷這一切流程被創造出來並產生價值；再來本文也提及在這個領域中的各種腳色、資料工程師、數據庫工程師、資料科學家和資料分析師的各種介紹。並且強調跨領域合作的重要性。

#人工智慧 #AI #資料科學

柴郡貓姍蒂的沙龍

2024/06/29

筆記-深度學習參數理解："input_shape"

前言在閱讀《強化式學習：打造最強 AlphaZero 通用演算法》時，對一些看似基本，但是重要且會影響到之後實作的項目概念有點疑惑，覺得應該查清楚，所以搞懂後記錄下來，寫下這篇文章(應該說是筆記？)。正文下面這段程式碼： model = Sequential() model.add

#閱讀筆記 #人工智慧 #名詞解釋

《專家事業研究室》沙龍

2024/06/09

【新手ＡＩ行銷線上課，簡單快速製文製圖製影片】

#啟發隨想 #新手AI行銷線上課 #銷售頁

凱文馬拉穆の雪橇犬星球

2024/06/01

股癌EP458筆記整理(Marvell、Dell、AI）

事前聲明：我先說明我的筆記製作流程：在YT下載 >> 生成逐字稿 >> 利用 AI 整理條列式筆記 >> 人工整理我已經將逐字稿放上來分享在<<1+1罐罐 | 股癌筆記 + 股癌未校稿逐字稿>>，不過逐字稿多少會有錯，如果要使用請多注意。 <<1+1罐罐 | 股癌筆記 + 股癌未校稿逐

#市場 #Dell #觀察

創作邦｜設計X工具X品牌的沙龍

2024/05/01

我如何從零開始接觸與學習 AI，超詳細學習方法與心得

AI 相關的內容每天都非常多，有聽過很多人因此感覺到焦慮，怕錯過了最新資訊就會趕不上，這篇內容會跟大家詳細的分享我自己的學習方法和經驗，並且會在最後分享一些我的學習資訊來源。

本文介紹了作者如何將書籍章節中重要的知識進行條理化整理，並提出效率化閱讀的方法，適用於任何領域的知識學習。

#書籍 #關鍵字 #閱讀

私大教育所 (私人大學教育研究所) by mr gary

2024/01/22

《Brief AI 電子報》每日 3 分鐘掌握 AI 趨勢

http://tinyurl.com/12000ai888 http://tinyurl.com/12000ai888 http://tinyurl.com/12000ai888

一世千銘

2024/08/04

閒章6

最近AI的産圖越來越多，是時候開始整理了，隨機生成的廢圖基本上都清除了，剩下一堆感覺不差的挑一挑，只是數量有點多。

廣告雜誌

2024/07/31

從資料清洗到 RAG，大型語言模型的必需品，做出專屬企業的 AI 知識庫！

#數據 #學習 #模型

解密 AI 與資料科學 (一) : AI 開發鏈, 跨領域溝通 & 最具未來性的職業

#人工智慧 #AI #資料科學

柴郡貓姍蒂的沙龍

2024/06/29

筆記-深度學習參數理解："input_shape"

#閱讀筆記 #人工智慧 #名詞解釋

《專家事業研究室》沙龍

2024/06/09

【新手ＡＩ行銷線上課，簡單快速製文製圖製影片】

#啟發隨想 #新手AI行銷線上課 #銷售頁

凱文馬拉穆の雪橇犬星球

2024/06/01

股癌EP458筆記整理(Marvell、Dell、AI）

#市場 #Dell #觀察

創作邦｜設計X工具X品牌的沙龍

2024/05/01

我如何從零開始接觸與學習 AI，超詳細學習方法與心得

本文介紹了作者如何將書籍章節中重要的知識進行條理化整理，並提出效率化閱讀的方法，適用於任何領域的知識學習。

#書籍 #關鍵字 #閱讀

私大教育所 (私人大學教育研究所) by mr gary

2024/01/22

《Brief AI 電子報》每日 3 分鐘掌握 AI 趨勢

http://tinyurl.com/12000ai888 http://tinyurl.com/12000ai888 http://tinyurl.com/12000ai888