筆記-強化式學習名詞解釋:"回饋值"、"回報值"、"價值"

閱讀時間約 2 分鐘

前言

最近開始讀《強化式學習:打造最強 AlphaZero 通用演算法》這本書,AlphaZero是AlphaGo的改良升級版,而AlphaGo打敗了世界頂尖圍棋棋士,這本書是在介紹AlphaZero使用的技術和演算法。這篇文章是筆記我在閱讀此書介紹"強化式學習"的篇幅時,遇到不懂的名詞解釋,上網查以及詢問ChatGPT,得到的答案。



正文

強化式學習的術語有:"代理人(agent)"、"環境(environment)"、"動作(action)"、"狀態(state)"、"回饋值(reward)"、"策略(policy)"、"回報值(return)"、"價值(value)"等。讓我困惑的是"回饋值"、"回報值"、"價值"。以下紀錄我找到並整理後的答案。


"回饋值"是指代理人(也就是主體)在某個狀態下做某個動作得到的回饋,例如:在遊戲中,角色吃到一個食物獲得 +10 分,碰到障礙物獲得 -10 分。


"回報值"是從某一時間 t 開始,直到最終所獲得的累積回饋值的和。它考慮了從現在到未來的所有回饋值,並引入折現因子(discount factor)來對未來的回饋值進行折現,以反映未來的不確定性。由於折現因子介於0和1之間,會對比較遠產生的回饋值打越多折,所以會有比教靠近現在產生的回饋值的重要性比較大的現象,可參考快速入門強化學習(Reinforcement Learning)的3.1章節。


"價值"就是期望回報值(expected return),它代表了在給定策略下代理人從當前狀態開始,到未來所有時間的累積回報值的期望值。由於強化學習環境通常具有隨機性和不確定性,因此未來的回報值並不是確定的,而是隨機變量的期望值。它的算法是由策略和狀態轉移機率和折現因子,去和回饋值相乘加總而得,像是在計算期望值。


這裡不紀錄計算公式,可參考快速入門強化學習(Reinforcement Learning);且裡面介紹了強化式學習演算法的理論基礎—馬可夫決策過程,作者寫得詳細又清楚,我還沒看完就加入書籤了(XD)。



參考



小結

會繼續閱讀此書,並將過程中由疑問找到解答的資料記錄下來,除了給其他人參考之外,自己以後再有一樣的疑惑時可以回來翻閱。


48會員
22Content count
留言0
查看全部
發表第一個留言支持創作者!
柴郡貓姍蒂的沙龍 的其他內容
好久沒回來這裡了。因為是家中長女,父親身障,不得不回到工程師身份工作。於去年經歷了一份主管很奇怪的公司工作(可以看我之前的文章"廢文-2")離開後,在年底應徵上了一家公司的後端工程師工作,在裡面待一直到現在(還會繼續待下去啦XD)。 今天因為身體不舒服向公司請假,也思考了現在的狀況以及未來的方向。
印象很深刻。那天擺攤,一位美甲師來我的攤位,挑的不是卡片,是粉絲團按讚的贈品,畫的主題是:"回家路上",我想她是一個有故事的人。聯想到林俊傑的一首歌:《不流淚的機場》,裡面唱到:"往前跑的人需要,擺脫遺憾的藥"。於是我將遊子出外打拼,五味雜陳的心情,用畫記錄下來。畫中遊子搭著飛機離開一個地方,不知道
雖然我的畫齡沒有很長,也不是專家,但我一直告訴自己:"不要忘記最一開始的自己"。 不知道是從哪裡知道這句話,大意上好像是說:"藝術家們到最後最難模仿的是一開始的自己"。這我個人覺得可以從幾個藝術家(不一定是繪畫方面)身上觀察到。 所以我跟自己說:"要記得畫畫的初心,要記得自己為什麼而畫"
向疫情、戰爭、人禍、天災離世的亡魂致意,安息吧,R.I.P.
總是不夠勇敢, 在道義面前輸給了面子, 下次一定要正面迎擊! 然後呀,覺得自己有進步, 只要不愧對自己的心, 不用刻意討好別人也沒關係, 要說就讓他們去說吧!
還記得那個失眠的夜晚,在床上翻來覆去睡不著覺,索性拿起床頭的手機和耳機來聽歌,想起不久前媽媽在客廳播的老歌—鄧麗君的《但願人長久》,於是就在YouTube上搜尋並聽了起來。 聽著聽著,腦中突然閃過一個想法:"我可以借這首歌的意境作一幅畫呀!",就這樣開始構思畫面。想到古人以酒敬月,而這首歌歌詞又是
好久沒回來這裡了。因為是家中長女,父親身障,不得不回到工程師身份工作。於去年經歷了一份主管很奇怪的公司工作(可以看我之前的文章"廢文-2")離開後,在年底應徵上了一家公司的後端工程師工作,在裡面待一直到現在(還會繼續待下去啦XD)。 今天因為身體不舒服向公司請假,也思考了現在的狀況以及未來的方向。
印象很深刻。那天擺攤,一位美甲師來我的攤位,挑的不是卡片,是粉絲團按讚的贈品,畫的主題是:"回家路上",我想她是一個有故事的人。聯想到林俊傑的一首歌:《不流淚的機場》,裡面唱到:"往前跑的人需要,擺脫遺憾的藥"。於是我將遊子出外打拼,五味雜陳的心情,用畫記錄下來。畫中遊子搭著飛機離開一個地方,不知道
雖然我的畫齡沒有很長,也不是專家,但我一直告訴自己:"不要忘記最一開始的自己"。 不知道是從哪裡知道這句話,大意上好像是說:"藝術家們到最後最難模仿的是一開始的自己"。這我個人覺得可以從幾個藝術家(不一定是繪畫方面)身上觀察到。 所以我跟自己說:"要記得畫畫的初心,要記得自己為什麼而畫"
向疫情、戰爭、人禍、天災離世的亡魂致意,安息吧,R.I.P.
總是不夠勇敢, 在道義面前輸給了面子, 下次一定要正面迎擊! 然後呀,覺得自己有進步, 只要不愧對自己的心, 不用刻意討好別人也沒關係, 要說就讓他們去說吧!
還記得那個失眠的夜晚,在床上翻來覆去睡不著覺,索性拿起床頭的手機和耳機來聽歌,想起不久前媽媽在客廳播的老歌—鄧麗君的《但願人長久》,於是就在YouTube上搜尋並聽了起來。 聽著聽著,腦中突然閃過一個想法:"我可以借這首歌的意境作一幅畫呀!",就這樣開始構思畫面。想到古人以酒敬月,而這首歌歌詞又是
你可能也想看
Thumbnail
重點摘要: 1.9 月降息 2 碼、進一步暗示年內還有 50 bp 降息 2.SEP 上修失業率預期,但快速的降息速率將有助失業率觸頂 3.未來幾個月經濟數據將繼續轉弱,經濟復甦的時點或是 1Q25 季底附近
Thumbnail
近期的「貼文發佈流程 & 版型大更新」功能大家使用了嗎? 新版式整體視覺上「更加凸顯圖片」,為了搭配這次的更新,我們推出首次貼文策展 ❤️ 使用貼文功能並完成這次的指定任務,還有機會獲得富士即可拍,讓你的美好回憶都可以用即可拍珍藏!
Thumbnail
★「有好好思考的人」和「沒在思考的人」的差異, 不在於思考的量,而在於思考的「質」!
Thumbnail
  本書討論美國擴張主義的歷史淵源及其演變。問題包括:為什麼美國總在不斷擴張,有時甚至直接介入干涉其他國家的事務?美國的擴張主義是怎樣形成的?這種擴張與它的歷史之間又具有什麼樣的關係?本書描述了美國征伐與暴力的歷史,也讓我們重新省視自己對美國的想像與認知。
Thumbnail
★看似客觀中立的機器運算,可能在學習人類提供的資料後,再複製社會偏見與歧視,形成「自動不平等」!
最近, 你在使用GPT來輔助閱讀和知識管理方面做了一些有趣的嘗試。 將外文文獻翻譯成繁體中文, 並添加標題以提升理解, 這種方法不僅讓閱讀變得更容易, 而且還能幫助你在數位筆記中有效地整理和思考信息。 以下是三個策略, 幫助你進一步利用GPT來提升你的學習和筆記效率。 ▋策略1 -
Thumbnail
對於大多數人來說,忘記是正常的一件事。但我們如果想要擁有強大的記憶力要如何做呢?《記憶強化全攻略》將簡淺易懂地告訴你關於記憶力的各種知
Thumbnail
親戚A分享自己近期買的小宅, 權狀只有二十坪,真的不大其實,高齡化社會早已不只在新聞標題中,這話題也開始漸漸出現在你我身邊,這位親戚A買得的是退休宅,原本住雙北老舊公寓,因為在四樓,她親眼見證,自己的婆婆,因高齡九十多歲,膝蓋不堪負擔,所以,終日無法下樓,過往喜歡逛百貨的婆婆,現在的一日三餐,全依賴
Thumbnail
日本即將在近期公開「政府安全保障能力強化支援」(Official Security Assistance, OSA)新制內容,可望為提供友軍防衛裝備或軍事協助開一道側門。本文將以5個問題介紹目前已知的「政府安全保障能力強化支援」內容是什麼。
★只用二十字傳達最重要的訊息,七秒吸睛、三十秒擄獲人心,讓目標對象立刻下單、採取行動! ●徹底刪除贅字,訊息就會簡單易懂。 ●KISS原則(Keep It Simple,Stupid,Keep It Simple,Short)取其首字,意思是簡潔表達。
Thumbnail
小摘要 意志力最高的三個時段 (1) 剛起床沒多久 (2) 肚子有點餓時 (3) 剛運動完,可安排重要任務,產能會大爆發。 飲食與運動可強化腦力 (1) 增加喝水量:大腦約80%都是水分,保持大腦的濕度十分重要,即使不口渴都要刻意攝取水份。 印象深刻的部分 #圖卡筆記 #24小時全為己用
Thumbnail
重點摘要: 1.9 月降息 2 碼、進一步暗示年內還有 50 bp 降息 2.SEP 上修失業率預期,但快速的降息速率將有助失業率觸頂 3.未來幾個月經濟數據將繼續轉弱,經濟復甦的時點或是 1Q25 季底附近
Thumbnail
近期的「貼文發佈流程 & 版型大更新」功能大家使用了嗎? 新版式整體視覺上「更加凸顯圖片」,為了搭配這次的更新,我們推出首次貼文策展 ❤️ 使用貼文功能並完成這次的指定任務,還有機會獲得富士即可拍,讓你的美好回憶都可以用即可拍珍藏!
Thumbnail
★「有好好思考的人」和「沒在思考的人」的差異, 不在於思考的量,而在於思考的「質」!
Thumbnail
  本書討論美國擴張主義的歷史淵源及其演變。問題包括:為什麼美國總在不斷擴張,有時甚至直接介入干涉其他國家的事務?美國的擴張主義是怎樣形成的?這種擴張與它的歷史之間又具有什麼樣的關係?本書描述了美國征伐與暴力的歷史,也讓我們重新省視自己對美國的想像與認知。
Thumbnail
★看似客觀中立的機器運算,可能在學習人類提供的資料後,再複製社會偏見與歧視,形成「自動不平等」!
最近, 你在使用GPT來輔助閱讀和知識管理方面做了一些有趣的嘗試。 將外文文獻翻譯成繁體中文, 並添加標題以提升理解, 這種方法不僅讓閱讀變得更容易, 而且還能幫助你在數位筆記中有效地整理和思考信息。 以下是三個策略, 幫助你進一步利用GPT來提升你的學習和筆記效率。 ▋策略1 -
Thumbnail
對於大多數人來說,忘記是正常的一件事。但我們如果想要擁有強大的記憶力要如何做呢?《記憶強化全攻略》將簡淺易懂地告訴你關於記憶力的各種知
Thumbnail
親戚A分享自己近期買的小宅, 權狀只有二十坪,真的不大其實,高齡化社會早已不只在新聞標題中,這話題也開始漸漸出現在你我身邊,這位親戚A買得的是退休宅,原本住雙北老舊公寓,因為在四樓,她親眼見證,自己的婆婆,因高齡九十多歲,膝蓋不堪負擔,所以,終日無法下樓,過往喜歡逛百貨的婆婆,現在的一日三餐,全依賴
Thumbnail
日本即將在近期公開「政府安全保障能力強化支援」(Official Security Assistance, OSA)新制內容,可望為提供友軍防衛裝備或軍事協助開一道側門。本文將以5個問題介紹目前已知的「政府安全保障能力強化支援」內容是什麼。
★只用二十字傳達最重要的訊息,七秒吸睛、三十秒擄獲人心,讓目標對象立刻下單、採取行動! ●徹底刪除贅字,訊息就會簡單易懂。 ●KISS原則(Keep It Simple,Stupid,Keep It Simple,Short)取其首字,意思是簡潔表達。
Thumbnail
小摘要 意志力最高的三個時段 (1) 剛起床沒多久 (2) 肚子有點餓時 (3) 剛運動完,可安排重要任務,產能會大爆發。 飲食與運動可強化腦力 (1) 增加喝水量:大腦約80%都是水分,保持大腦的濕度十分重要,即使不口渴都要刻意攝取水份。 印象深刻的部分 #圖卡筆記 #24小時全為己用