We use data science and artificial intelligence to solve problems in three different areas: 1) bioinformatics and therapeutic peptide drug development, 2) natural language processing and large language model applications, 3) data science and AI-driven problem solving. In addition, we collaborate with experts from diverse domains, bringing our data science expertise to the table. We develop various AI/data science methods to solve various problems.
實驗室的研究方向為開發計算系統、演算法、以及人工智慧工具以解決生物醫學問題,研究領域包含:1) 生物資訊與醫療用胜肽藥物開發,2) 自然語言處理及大語言模型應用,3) 資料科學與AI建模,此外,我們積極與其他領域的專家展開合作,將我們的數據科學專長融入其中。我們致力於開發多樣化的人工智慧與數據科學方法,以應對各個領域的挑戰,解決不同範疇的問題。
Highly motivated students who want to pursue master education or accumulate practical research experiences are encouraged to join us. We welcome students with diverse interests, whether they wish to conduct research, develop practical software solutions, or simply enhance their programming proficiency through hands-on projects.
Undergraduate or graduate students are welcomed. Please send me an email if you are interested.
我們歡迎主動積極、想攻讀研究所、需要累積作品與成果、或單純覺得「寫程式好像挺酷」的同學。
如果你想提前開始專題、想做出一點會在履歷上吸晴的成果、想用程式暴打真實世界的問題,或只是想靠小型 project 練功升級,我們的實驗室都有資源可以協助你。
不管你是大一、大二、專題生、研究生、還是剛走錯教室但覺得這裡好像不錯的路人,都歡迎加入我們。
想了解更多?直接寫信給我,我保證回信速度比我 debug 快。
醫療用胜肽(therapeutic peptide)相較於傳統藥物有專一性高、副作用低等優點,我們的研究則是用機器學習、蛋白質語言模型、深度學習等黑科技,來預測哪些胜肽有機會成為醫療界的明日之星。
以資訊工程角度而言,peptide是一個包含20個英文字母(氨基酸)的字串,因此許多序列處理、自然語言技術可應用於蛋白質序列的分析與應用上。這類型peptide應用廣泛,例如抗微生物(用以替代抗生素)、抗高血壓、抗癌、抗老化等。
我們實驗室已經在這領域發表多篇 SCI Q1 國際論文(其中不少還是大學生的專題成果,沒錯,我們的大學生超會打怪),現在也持續開發更狂的新型計算方法,努力把預測準確率推到更高。
2024 年諾貝爾化學獎給了 David Baker、Demis Hassabis、John M. Jumper,他們把深度學習用在蛋白質結構與序列設計上,科學界直接拍手拍到手酸。連黃仁勳都說 Programmable Biology 是人類科技的未來。
那麼問題來了:
透過生成式 AI,我們能不能直接「設計」出能殺死癌細胞的抗體?能不能預測出抗高血壓、抗老化的蛋白質片段?能不能用演算法讓醫學突破再升級?透過機器學習、演算法設計,加上生物醫學資料庫裡的大量數據,我們其實正在做一件很浪漫的事:
用資訊技術對抗癌症、延長存活、打造新型態藥物,甚至讓人類活得更健康。(如果聽起來像科幻片,那就對了——我們就是在把它變成現實。)
我們使用大型語言模型、深度學習、以及機器學習處理各式各樣的文獻資料。簡單說,就是讓 AI 幫我們看資料、整理資料、理解資料——反正就是做那些人類研究者看到會想先泡杯咖啡再決定要不要看的事情。
與國立高雄科技大學、澳洲 UNSW 合作
舉辦教育部 AICup 競賽,並從 UNSW 附設醫院取得醫學病例。接著我們用大型語言模型幫病歷做「個資去識別化」——也就是教 AI 把敏感資訊藏得比藏私房錢還隱密。
與亞洲大學 聽力暨語言治療學系合作
使用大型語言模型來分析兒童敘事能力,順便提供治療方向建議。換句話說,就是讓 AI 聽孩子講故事,然後不會打瞌睡,還能給專業建議。
與國立臺北大學合作
進行 ESG 永續承諾標注、AI 建模與資料分析。簡單講,就是讓 AI 幫忙判斷企業永不永續、誠不誠意,比看財報還快,也比問股市還可靠。
如果你喜歡把 AI 當隊友、讓它一起看論文、一起看病例、一起看企業資料——我們做的就是這種事。
我們積極拓展跨界合作,把人工智慧/機器學習推向各種專業領域。簡單說,就是到處出沒、用 AI 解決別人的難題,扮演各行各業的 problem solver。透過挖掘那些躲在複雜數據深處的知識,我們幫助合作領域找到新的發現——有點像「資料界的偵探」,但不用風衣。
語言治療 (與亞洲大學聽力暨語言治療學系合作)
我們執行科技部計畫《探討老化與溝通能力的轉變:評估、分析與工具開發》。目標是用 AI 打造一套快速評估老年人言語(speech)、語言(language)、聽力(acoustics)的新工具。
為什麼?因為現有的評估方式又慢又花人力,做一次感覺像在跑馬拉松。我們希望讓檢測變成「快速版健康檢查」,在烏龍茶涼掉之前就可把檢測完成。
此外,我們也取得了兒童的廣東話語言溝通能力資料,利用機器學習與智慧化特徵選擇方法,分析小朋友的受測數據,用更快、更簡單、也更不折磨大人的方式,儘早辨識可能存在溝通障礙的兒童。
再自殺預測 (與高醫大精神科、高雄科大電機系合作)
在臨床上,自殺防治的重要性不用多說,而「再自殺風險預測」更是核心中的核心。我們使用機器學習從每位病患超過 200 個特徵中挑出最重要的訊息,再結合模型預測其再自殺的風險。
換句話說,就是用 AI 協助臨床醫生提前察覺危險訊號,給病患更及時、更精準的幫助。希望讓科技真正變成挽救生命的工具,而不是只拿來幫忙寫程式和分辨貓狗。
以機器學習技術篩選定量偏差值大的圖譜
在標記化蛋白質體學(isobaric labeling proteomics)裡,圖譜品質就是定量準不準的關鍵。圖譜好,結果準;圖譜差,就像量體重前先吃兩碗滷肉飯——偏差肯定大。但麻煩的是,目前還沒有 AI 能提前告訴我們「哪些圖譜容易亂飄」。
所以我們乾脆自己動手,把 XGBoost、LightGBM、Extra Trees 等幾套超會分類的演算法請來開工,讓它們負責「挑圖」。任務很簡單:把偏差值大的圖譜揪出來,丟到一邊休息;把品質好的圖譜留下來,乖乖做後續蛋白質定量。
成果?模型真的挑得不錯,論文也在 2025 年 8 月被 Scientific Reports 接受。簡單說,我們讓機器學習成為圖譜界的「品管小幫手」,效果好到國際期刊都點頭。