Nature 2024年重要的七項科技之一:蛋白質序列的深度學習模型

閱讀時間約 4 分鐘



[Nature]期刊用「人工智能的進步是今年許多最令人興奮的技術創新領域的核心。」來公布2024年重要的七項科技,其中一項是「蛋白質序列的深度學習模型」。


以下整段引用自 [科學期刊]

破解蛋白質結構是個十分耗費時間的工作,即使已經得知了一個蛋白質的一級結構──也就是它的胺基酸序列,也並不代表科學家能切實掌握它的三級或四級結構,但更不用說其實立體結構才是真正決定一個蛋白質功能的重點。破解蛋白質結構不容易,設計一款新型蛋白質當然也就更加地困難。然而近年來人工智慧的進展,生物學家不僅將此技術運用於破解蛋白質的立體結構,更衍伸出以深度學習(deep learning)協助設計新型蛋白質的方法。


上面這段話,說明了「蛋白質設計」的應用從「生物醫學」到「環境科學」等各個領域解決問題方面具有巨大潛力,也說明了為何Nature將這個技術視為最重要的七項科技,這也代表著2022年發表的論文,到目前受到自然期刊的推薦,代表了目前這項技術在2024年的醫藥生技科研領域舉足輕重。


因此,我找到了原文,試圖用一個有限制的已知,試圖分享AI-NLP應用在蛋白質序列的未知。


相信在很早之前,AI領域有注意到一則新聞,就是AlphaFold已經研究蛋白質序列問題。其實在很早,科學家就注意到蛋白質序列與人類語言之間是有些許雷同的。尤其是蛋白質序列可以描述為字母之間的連結,即天然氨基酸,就像人類語言一樣,這些字母排列成次級結構元素("詞"),這些結構元素組合形成域("句子"),段落則具有執行功能("含義")。其中一個最吸引人的相似之處是,蛋白質序列,像自然語言一樣,是信息完整的:它們以極高的效率將結構和功能完全存儲在其氨基酸序列中。因此,也許大型預訓練語言模型可以讓蛋白質序列的設計問題,有所助益。


拜羅伊特大學 (University of Bayreuth) 生化系人工智慧蛋白質設計團隊(Artificial Intelligence for Protein Design)的主持人 Noelia Ferruz 女士,發表了本篇論文,“ProtGPT2 is a deep unsupervised language model for protein design”,並解決以下三個研究問題

(i) 有效地學習蛋白質語言

(ii) 生成適合、穩定的蛋白質

(iii) 理解這些序列與自然序列之間的關係


該團隊將這個訓練模型稱為「ProtGPT2」,該模型是一個具有7.38億參數的自迴歸Transformer模型,能夠以生成全新的蛋白質序列。這個模型學習了約5000萬個未標記序列,涵蓋了整個蛋白質空間後,已經有效地學會了蛋白質語言。同時,ProtGPT2 生成的序列顯示出與自然對應物相似的預測穩定性和動態特性。由於ProtGPT2已經預先訓練過,它可以在標準工作站上在幾秒鐘內生成序列,或者進一步在研究者選擇的序列集上進行微調,以增強特定的蛋白質家族。(相關的模型和數據集已公布在HuggingFace中)


隨著NLP領域在理解和生成接近人類能力的語言方面取得的非凡進步,後學相信在醫藥生技領域,自然語言處理「序列單獨進行蛋白質相關問題(如蛋白質設計)」的新途徑已經逐漸成熟,儘管蛋白質序列和人類語言存在不同之處,但它們的類比已經啟動了數十年來應用NLP方法解決蛋白質的相關研究。


感謝您閱讀完畢長文,後學一直在人工智慧與自然語言領域發展,尤其專注醫藥生技領域,如果有進一步的興趣,歡迎一起研討

資料來源:https://www.ncbi.nlm.nih.gov/pmc/articles/PMC9329459/

歡迎各領域研究者,共同合作研究:

https://www.facebook.com/akousist

https://line.me/R/ti/p/@875lzikp

M-Insight : AI科技創新 分享有關人工智慧對於產業與企業的實務應用、研究成果、產業情報等資訊,歡迎人工智慧、醫藥生技、科技管理領域的同好、專家學者、醫師、研究人員與業界朋友一同參與交流。
留言0
查看全部
發表第一個留言支持創作者!
今天分享長期觀察 AI 議題的 Martin Signoux 對2024年AI技術領域的觀點。他認為「大型語言模型」未來將不具備任何優勢,未來發展是「大型多模態模型」,而且在2024年的議題量將會超越「大型語言模型」,此觀點也受到楊立昆(Yann LeCuu)的認同。
根據美國FDA的數據顯示,2023年的申請量是歷年最大,放射學領域是AI/ML-SaMD的醫材設備申請數持續穩定成長的科別。AI/ML-SaMD的醫材設備通過量預計將成長30%以上。放射科領域佔全部通過量的76%,估計2023年也將保持居冠。
今天分享長期觀察 AI 議題的 Martin Signoux 對2024年AI技術領域的觀點。他認為「大型語言模型」未來將不具備任何優勢,未來發展是「大型多模態模型」,而且在2024年的議題量將會超越「大型語言模型」,此觀點也受到楊立昆(Yann LeCuu)的認同。
根據美國FDA的數據顯示,2023年的申請量是歷年最大,放射學領域是AI/ML-SaMD的醫材設備申請數持續穩定成長的科別。AI/ML-SaMD的醫材設備通過量預計將成長30%以上。放射科領域佔全部通過量的76%,估計2023年也將保持居冠。
本篇參與的主題策展
先前麥克買了在預算及性能方面都十分複合需求的NXTPAPER 11平板,但拿到辦公室使用後便發現因為時不時有簡報需求,主機本身不支援有線視訊輸出實在是非常不方便,因又開始尋找新歡。最終麥克選擇了算是還滿熟悉的品牌小米旗下的小米平板6,以下為麥克這一個月下來的使用心得。
從預計的十月底出貨經過重重波折,Pubu自家開發的10寸彩色閱讀器Pubook Pro終於是送到第一批集資者手中了。究竟這台閱讀器有沒有本事撼動目前的電子紙閱讀器市場?有達到集資時承諾的各項功能嗎?且讓身為首批集資者之一的麥克跟大家談談收到主機後使用數天的感想。
Steam Deck 迎來大改版,最重要的更新就是換成 OLED 螢幕。使用 OLED 螢幕帶來更好看的顏色,大小還小幅提升到 7.4 吋。關係續航力的電池也從 40 瓦小時升級到 50 瓦小時, 3A 大作都可以多玩一小時呢!這麼香的更新,怎麼不給他買下去呢 😄
先前麥克買了在預算及性能方面都十分複合需求的NXTPAPER 11平板,但拿到辦公室使用後便發現因為時不時有簡報需求,主機本身不支援有線視訊輸出實在是非常不方便,因又開始尋找新歡。最終麥克選擇了算是還滿熟悉的品牌小米旗下的小米平板6,以下為麥克這一個月下來的使用心得。
從預計的十月底出貨經過重重波折,Pubu自家開發的10寸彩色閱讀器Pubook Pro終於是送到第一批集資者手中了。究竟這台閱讀器有沒有本事撼動目前的電子紙閱讀器市場?有達到集資時承諾的各項功能嗎?且讓身為首批集資者之一的麥克跟大家談談收到主機後使用數天的感想。
Steam Deck 迎來大改版,最重要的更新就是換成 OLED 螢幕。使用 OLED 螢幕帶來更好看的顏色,大小還小幅提升到 7.4 吋。關係續航力的電池也從 40 瓦小時升級到 50 瓦小時, 3A 大作都可以多玩一小時呢!這麼香的更新,怎麼不給他買下去呢 😄
你可能也想看
Google News 追蹤
Thumbnail
這個秋,Chill 嗨嗨!穿搭美美去賞楓,裝備款款去露營⋯⋯你的秋天怎麼過?秋日 To Do List 等你分享! 秋季全站徵文,我們準備了五個創作主題,參賽還有機會獲得「火烤兩用鍋」,一起來看看如何參加吧~
Thumbnail
美國總統大選只剩下三天, 我們觀察一整週民調與金融市場的變化(包含賭局), 到本週五下午3:00前為止, 誰是美國總統幾乎大概可以猜到60-70%的機率, 本篇文章就是以大選結局為主軸來討論近期甚至到未來四年美股可能的改變
Thumbnail
Faker昨天真的太扯了,中國主播王多多點評的話更是精妙,分享給各位 王多多的點評 「Faker是我們的處境,他是LPL永遠繞不開的一個人和話題,所以我們特別渴望在決賽跟他相遇,去直面我們的處境。 我們曾經稱他為最高的山,最長的河,以為山海就是盡頭,可是Faker用他28歲的年齡...
Thumbnail
四季通用又輕巧易攜,有誰能夠抗拒? Korean fragrance products are so attractive.
Thumbnail
最新的研究說:「正確的選擇並不只需要資訊。」
Thumbnail
在社會網路研究中,人際間的網路有時不像企業間網路容易定義。企業間的投資、合資或是策略聯盟之間的連結清清楚楚,但是人際之間未必如此,有時你以為是朋友的,對方卻不如此認為;有時你的情比金堅,對方卻以為不過是點頭之交。 相較之下,人與人的性連結究竟與其他形式的人與人的連結有何不同?
Thumbnail
「己然」一詞在今天的中文裡雖不多見,但是古代漢字文化卻曾見諸於文字中,例如西漢時期的博士戴通編纂的《禮記》之《大戴禮記.禮察篇》中就記載「凡人之知,能見己然,不能見將然。禮者禁于將然之前,而法者禁于己然之後。是故法之用易見,而禮之所為至難知也。」,即意通「自然」之意。......
公元三千的搖滾樂手。第一首: MUSE - Nature 1歌詞翻譯
Thumbnail
這個秋,Chill 嗨嗨!穿搭美美去賞楓,裝備款款去露營⋯⋯你的秋天怎麼過?秋日 To Do List 等你分享! 秋季全站徵文,我們準備了五個創作主題,參賽還有機會獲得「火烤兩用鍋」,一起來看看如何參加吧~
Thumbnail
美國總統大選只剩下三天, 我們觀察一整週民調與金融市場的變化(包含賭局), 到本週五下午3:00前為止, 誰是美國總統幾乎大概可以猜到60-70%的機率, 本篇文章就是以大選結局為主軸來討論近期甚至到未來四年美股可能的改變
Thumbnail
Faker昨天真的太扯了,中國主播王多多點評的話更是精妙,分享給各位 王多多的點評 「Faker是我們的處境,他是LPL永遠繞不開的一個人和話題,所以我們特別渴望在決賽跟他相遇,去直面我們的處境。 我們曾經稱他為最高的山,最長的河,以為山海就是盡頭,可是Faker用他28歲的年齡...
Thumbnail
四季通用又輕巧易攜,有誰能夠抗拒? Korean fragrance products are so attractive.
Thumbnail
最新的研究說:「正確的選擇並不只需要資訊。」
Thumbnail
在社會網路研究中,人際間的網路有時不像企業間網路容易定義。企業間的投資、合資或是策略聯盟之間的連結清清楚楚,但是人際之間未必如此,有時你以為是朋友的,對方卻不如此認為;有時你的情比金堅,對方卻以為不過是點頭之交。 相較之下,人與人的性連結究竟與其他形式的人與人的連結有何不同?
Thumbnail
「己然」一詞在今天的中文裡雖不多見,但是古代漢字文化卻曾見諸於文字中,例如西漢時期的博士戴通編纂的《禮記》之《大戴禮記.禮察篇》中就記載「凡人之知,能見己然,不能見將然。禮者禁于將然之前,而法者禁于己然之後。是故法之用易見,而禮之所為至難知也。」,即意通「自然」之意。......
公元三千的搖滾樂手。第一首: MUSE - Nature 1歌詞翻譯