Nature 2024年重要的七項科技之一:蛋白質序列的深度學習模型

更新於 發佈於 閱讀時間約 4 分鐘



[Nature]期刊用「人工智能的進步是今年許多最令人興奮的技術創新領域的核心。」來公布2024年重要的七項科技,其中一項是「蛋白質序列的深度學習模型」。


以下整段引用自 [科學期刊]

破解蛋白質結構是個十分耗費時間的工作,即使已經得知了一個蛋白質的一級結構──也就是它的胺基酸序列,也並不代表科學家能切實掌握它的三級或四級結構,但更不用說其實立體結構才是真正決定一個蛋白質功能的重點。破解蛋白質結構不容易,設計一款新型蛋白質當然也就更加地困難。然而近年來人工智慧的進展,生物學家不僅將此技術運用於破解蛋白質的立體結構,更衍伸出以深度學習(deep learning)協助設計新型蛋白質的方法。


上面這段話,說明了「蛋白質設計」的應用從「生物醫學」到「環境科學」等各個領域解決問題方面具有巨大潛力,也說明了為何Nature將這個技術視為最重要的七項科技,這也代表著2022年發表的論文,到目前受到自然期刊的推薦,代表了目前這項技術在2024年的醫藥生技科研領域舉足輕重。


因此,我找到了原文,試圖用一個有限制的已知,試圖分享AI-NLP應用在蛋白質序列的未知。


相信在很早之前,AI領域有注意到一則新聞,就是AlphaFold已經研究蛋白質序列問題。其實在很早,科學家就注意到蛋白質序列與人類語言之間是有些許雷同的。尤其是蛋白質序列可以描述為字母之間的連結,即天然氨基酸,就像人類語言一樣,這些字母排列成次級結構元素("詞"),這些結構元素組合形成域("句子"),段落則具有執行功能("含義")。其中一個最吸引人的相似之處是,蛋白質序列,像自然語言一樣,是信息完整的:它們以極高的效率將結構和功能完全存儲在其氨基酸序列中。因此,也許大型預訓練語言模型可以讓蛋白質序列的設計問題,有所助益。


拜羅伊特大學 (University of Bayreuth) 生化系人工智慧蛋白質設計團隊(Artificial Intelligence for Protein Design)的主持人 Noelia Ferruz 女士,發表了本篇論文,“ProtGPT2 is a deep unsupervised language model for protein design”,並解決以下三個研究問題

(i) 有效地學習蛋白質語言

(ii) 生成適合、穩定的蛋白質

(iii) 理解這些序列與自然序列之間的關係


該團隊將這個訓練模型稱為「ProtGPT2」,該模型是一個具有7.38億參數的自迴歸Transformer模型,能夠以生成全新的蛋白質序列。這個模型學習了約5000萬個未標記序列,涵蓋了整個蛋白質空間後,已經有效地學會了蛋白質語言。同時,ProtGPT2 生成的序列顯示出與自然對應物相似的預測穩定性和動態特性。由於ProtGPT2已經預先訓練過,它可以在標準工作站上在幾秒鐘內生成序列,或者進一步在研究者選擇的序列集上進行微調,以增強特定的蛋白質家族。(相關的模型和數據集已公布在HuggingFace中)


隨著NLP領域在理解和生成接近人類能力的語言方面取得的非凡進步,後學相信在醫藥生技領域,自然語言處理「序列單獨進行蛋白質相關問題(如蛋白質設計)」的新途徑已經逐漸成熟,儘管蛋白質序列和人類語言存在不同之處,但它們的類比已經啟動了數十年來應用NLP方法解決蛋白質的相關研究。


感謝您閱讀完畢長文,後學一直在人工智慧與自然語言領域發展,尤其專注醫藥生技領域,如果有進一步的興趣,歡迎一起研討

資料來源:https://www.ncbi.nlm.nih.gov/pmc/articles/PMC9329459/

歡迎各領域研究者,共同合作研究:

https://www.facebook.com/akousist

https://line.me/R/ti/p/@875lzikp

留言
avatar-img
留言分享你的想法!
avatar-img
M-Insight:AI科技創新
18會員
24內容數
M-Insight : AI科技創新 分享有關人工智慧對於產業與企業的實務應用、研究成果、產業情報等資訊,歡迎人工智慧、醫藥生技、科技管理領域的同好、專家學者、醫師、研究人員與業界朋友一同參與交流。
2024/06/22
Vertex Pharmaceuticals Incorporated公佈其用於治療1型糖尿病患者的幹細胞衍生胰島細胞療法VX-880在臨床試驗中的最新數據,顯示療效與此前報告一致。
Thumbnail
2024/06/22
Vertex Pharmaceuticals Incorporated公佈其用於治療1型糖尿病患者的幹細胞衍生胰島細胞療法VX-880在臨床試驗中的最新數據,顯示療效與此前報告一致。
Thumbnail
2024/04/28
這篇研究探討了不同醫學主題中,大型語言模型對於知識的性能差異,特別是針對腫瘤學領域的幾種主流LLMs進行評估。研究表明,大型語言模型在基礎主題上展示出比臨床腫瘤學更高的準確性,但模型仍具有一定程度的不準確性。研究結果為醫療專業人員和患者更有效地利用LLMs提供了實證支持。
Thumbnail
2024/04/28
這篇研究探討了不同醫學主題中,大型語言模型對於知識的性能差異,特別是針對腫瘤學領域的幾種主流LLMs進行評估。研究表明,大型語言模型在基礎主題上展示出比臨床腫瘤學更高的準確性,但模型仍具有一定程度的不準確性。研究結果為醫療專業人員和患者更有效地利用LLMs提供了實證支持。
Thumbnail
2024/03/14
本篇文章分享在NEJM上的重磅研究,利用AI技術從生物醫學訊號中推斷糖尿病患者在駕駛時的低血糖狀態。該研究填補了低血糖即時監測的缺口,提出了非侵入性的低血糖檢測解決方案。透過分析駕駛行為和視線/頭部運動數據,提取特徵並開發機器學習模型,成功偵測低血糖狀態。研究結果具有非常重要的醫療和交通安全意義。
Thumbnail
2024/03/14
本篇文章分享在NEJM上的重磅研究,利用AI技術從生物醫學訊號中推斷糖尿病患者在駕駛時的低血糖狀態。該研究填補了低血糖即時監測的缺口,提出了非侵入性的低血糖檢測解決方案。透過分析駕駛行為和視線/頭部運動數據,提取特徵並開發機器學習模型,成功偵測低血糖狀態。研究結果具有非常重要的醫療和交通安全意義。
Thumbnail
看更多
你可能也想看
Thumbnail
「欸!這是在哪裡買的?求連結 🥺」 誰叫你太有品味,一發就讓大家跟著剁手手? 讓你回購再回購的生活好物,是時候該介紹出場了吧! 「開箱你的美好生活」現正召喚各路好物的開箱使者 🤩
Thumbnail
「欸!這是在哪裡買的?求連結 🥺」 誰叫你太有品味,一發就讓大家跟著剁手手? 讓你回購再回購的生活好物,是時候該介紹出場了吧! 「開箱你的美好生活」現正召喚各路好物的開箱使者 🤩
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 87 說:Wang 等人 2019 年的論文,提供了合理答案的選擇 (Choice of Plausible Answers, COP
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 87 說:Wang 等人 2019 年的論文,提供了合理答案的選擇 (Choice of Plausible Answers, COP
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 新模型和 Human Baselines 排名將不斷變化,Human Baselines 的位置自從基礎模型出現以來,它就不再具有多大意義了,這些排名只是表明經典 NL
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 新模型和 Human Baselines 排名將不斷變化,Human Baselines 的位置自從基礎模型出現以來,它就不再具有多大意義了,這些排名只是表明經典 NL
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 77 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 77 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 76 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 76 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 75 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 回顧 AI說書 - 從0開始 - 75 ,我們在給定句子 「 Transformers possess surprising emerging features 」的情
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 Transformers for Natural Language Processing and Computer Vision, 2024 這本書中講 Decoder
Thumbnail
我想要一天分享一點「LLM從底層堆疊的技術」,並且每篇文章長度控制在三分鐘以內,讓大家不會壓力太大,但是又能夠每天成長一點。 Transformers for Natural Language Processing and Computer Vision, 2024 這本書中講 Decoder
Thumbnail
預計量子AI計算會在2032年左右來到,在這之前,我們還有充足的時間可以逐步去學習量子計算與演算法,讓我們按部就班,持續前進,做輕鬆無負擔的超前學習 !
Thumbnail
預計量子AI計算會在2032年左右來到,在這之前,我們還有充足的時間可以逐步去學習量子計算與演算法,讓我們按部就班,持續前進,做輕鬆無負擔的超前學習 !
追蹤感興趣的內容從 Google News 追蹤更多 vocus 的最新精選內容追蹤 Google News