Learn AI 不 BI

AI說書 - 從0開始 - 288 | Tokenizer 重要性範例之 Embedding 訓練

發佈於三分鐘學AI (2)

更新於 2025/01/06發佈於 2025/01/06閱讀時間約 3 分鐘

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。

延續 AI說書 - 從0開始 - 287 | Tokenizer 重要性範例之資料準備，接著來執行 Tokenization：

sample = open("text.txt", "r")
s = sample.read()

f = s.replace("\n", " ")
data = []

for i in sent_tokenize(f):
	temp = []
	for j in word_tokenize(i):
		temp.append(j.lower())
	data.append(temp)
	
	
# Creating Skip Gram model
model2 = gensim.models.Word2Vec(data, min_count = 1, vector_size = 512, window = 5, sg = 1)
print(model2)

window = 5 限制輸入句子中當前單字和預測單字之間的距離，結果為：

raw-image

為了要檢視效果好壞，我們撰寫一隻計算 Cosine 相似度的程式：

def similarity(word1, word2):
	cosine = False
	try:
		a = model2[word1]
		cosine = True
	except KeyError:
		print(word1, ":[unk] key not found in dictionary")
	
	try:
		b = model2[word2]
	except KeyError:
		cosine = False
		print(word2, ":[unk] key not found in dictionary")
	
	if(cosine == True):
		dot = np.dot(a, b)
		norma = np.linalg.norm(a)
		normb = np.linalg.norm(b)
		cos = dot / (norma * normb)
		
		aa = a.reshape(1,512)
		ba = b.reshape(1,512)
		cos_lib = cosine_similarity(aa, ba)
	if(cosine == False):
		cos_lib = 0
	return cos_lib

#PromptEngineering

#chatgpt怎麼用

Learn AI 不 BI三分鐘學AI (2)AI從0開始-第十章

Learn AI 不 BI

190會員

502內容數

這裡將提供： AI、Machine Learning、Deep Learning、Reinforcement Learning、Probabilistic Graphical Model的讀書筆記與演算法介紹，一起在未來AI的世界擁抱AI技術，不BI。

留言0

查看全部

發表第一個留言支持創作者！

Learn AI 不 BI 的其他內容

AI說書 - 從0開始 - 287 | Tokenizer 重要性範例之資料準備

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們先匯入必須要的程式庫： !pip install gensim import nltk nltk.download('punkt') import math i

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 286 | Word2Vec Tokenization 交互關係

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。只要一切順利，沒有人會去考慮預訓練的 Tokenizer，這就像現實生活中一樣，我們可以多年駕駛一輛車而不去想引擎的問題。然後有一天，車子突然拋錨了，我們才開始試圖找出

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 285 | AI 人工品質控制

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。 Transformers 將逐漸接管大多數複雜的自然語言處理任務，然而，人類的干預仍然是必不可少的，正確的方法是訓練一個 Transformers，實現它，控制輸出，並

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 284 | 語言訓練資料的準備建議

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。訓練好的模型會像學習了一種語言的人一樣運作，它會理解自己能理解的內容，並從輸入數據中學習，輸入數據應該經過與第一步相同的預處理過程，並將新信息添加到訓練數據集中，訓練數

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 283 | 語言訓練資料的準備建議

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。 Raffel 等人於 2019 定義了標準文字到文字 T5 Transformer 模型，他們還走得更遠，他們為打破未經預處理就使用原始資料的神話做出了貢獻，預處理資料

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 282 | 第十章目錄

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。子詞 Tokenizer 展示了 Tokenizer 如何影響 Transformer 模型的訓練和性能，我們將了解如何檢測哪種子詞 Tokenizer 被用來創建詞典

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 287 | Tokenizer 重要性範例之資料準備

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們先匯入必須要的程式庫： !pip install gensim import nltk nltk.download('punkt') import math i

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 286 | Word2Vec Tokenization 交互關係

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。只要一切順利，沒有人會去考慮預訓練的 Tokenizer，這就像現實生活中一樣，我們可以多年駕駛一輛車而不去想引擎的問題。然後有一天，車子突然拋錨了，我們才開始試圖找出

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 285 | AI 人工品質控制

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。 Transformers 將逐漸接管大多數複雜的自然語言處理任務，然而，人類的干預仍然是必不可少的，正確的方法是訓練一個 Transformers，實現它，控制輸出，並

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 284 | 語言訓練資料的準備建議

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。訓練好的模型會像學習了一種語言的人一樣運作，它會理解自己能理解的內容，並從輸入數據中學習，輸入數據應該經過與第一步相同的預處理過程，並將新信息添加到訓練數據集中，訓練數

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 283 | 語言訓練資料的準備建議

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。 Raffel 等人於 2019 定義了標準文字到文字 T5 Transformer 模型，他們還走得更遠，他們為打破未經預處理就使用原始資料的神話做出了貢獻，預處理資料

#AI #ai #PromptEngineering

AI說書 - 從0開始 - 282 | 第十章目錄

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。子詞 Tokenizer 展示了 Tokenizer 如何影響 Transformer 模型的訓練和性能，我們將了解如何檢測哪種子詞 Tokenizer 被用來創建詞典

#AI #ai #PromptEngineering

你可能也想看

Google News 追蹤

Learn AI 不 BI

AI說書 - 從0開始 - 66

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。先做個總回顧： Transformer 架構總覽：AI說書 - 從0開始 - 39 Attention 意圖說明：AI說書 - 從0開始 - 40 Transfo

#AI #ai #PositionalEncoding

Learn AI 不 BI

AI說書 - 從0開始 - 58

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 57

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 56

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 54

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 51

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。講完 Transformer 之 Encoder 架構中的 Embedding 與 Positional Encoding 部分，現在進入 Multi-Head Att

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 50

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。這裡做 Embedding 與 Postional Encoding 的邏輯梳理與結論： Embedding 訓練方式：AI說書 - 從0開始 - 43 Embed

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 49

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。再度回到 Transformer 架構中的 Encoder 部分，如下圖所示：我現在手上有的素材如下： Embedding 訓練方式：AI說書 - 從0開始

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 44

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們已經在AI說書 - 從0開始 - 43中，闡述了 Embedding 的訓練方式，現在我們來看是否 Embedding 如我們預期般運作：假設我的目標句子是

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 43

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們在AI說書 - 從0開始 - 42中，見識了 Tokenizer 做的事情了，以下來羅列幾個要點：它將原始文字轉成小寫有可能將原始文字再進行切割通常 T

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 66

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。先做個總回顧： Transformer 架構總覽：AI說書 - 從0開始 - 39 Attention 意圖說明：AI說書 - 從0開始 - 40 Transfo

#AI #ai #PositionalEncoding

Learn AI 不 BI

AI說書 - 從0開始 - 58

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 57

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 56

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 54

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。目前我們已經完成： Single-Head Attention 數學說明：AI說書 - 從0開始 - 52 Multi-Head Attention 數學說明：AI

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 51

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。講完 Transformer 之 Encoder 架構中的 Embedding 與 Positional Encoding 部分，現在進入 Multi-Head Att

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 50

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。這裡做 Embedding 與 Postional Encoding 的邏輯梳理與結論： Embedding 訓練方式：AI說書 - 從0開始 - 43 Embed

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 49

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。再度回到 Transformer 架構中的 Encoder 部分，如下圖所示：我現在手上有的素材如下： Embedding 訓練方式：AI說書 - 從0開始

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 44

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們已經在AI說書 - 從0開始 - 43中，闡述了 Embedding 的訓練方式，現在我們來看是否 Embedding 如我們預期般運作：假設我的目標句子是

#AI #ai #PromptEngineering

Learn AI 不 BI

AI說書 - 從0開始 - 43

我想要一天分享一點「LLM從底層堆疊的技術」，並且每篇文章長度控制在三分鐘以內，讓大家不會壓力太大，但是又能夠每天成長一點。我們在AI說書 - 從0開始 - 42中，見識了 Tokenizer 做的事情了，以下來羅列幾個要點：它將原始文字轉成小寫有可能將原始文字再進行切割通常 T

#AI #ai #PromptEngineering