常被問到,「用 AI 來做研究,到底可不可以?」

現在工具很多,從問答型 AI,到能自己跑流程的 AI agent,也包括各種用 AI 打造查詢介面的資料庫工具,甚至網路上大量免費分享的 skills。這些東西,究竟能不能拿來當研究工具?

有人說「AI 會出包」,有人說「會出包那是你不會用」,有人說「你看我這樣很快就生出整篇」,也有人說「你那個拿去投稿會出事」。到底哪個對?

這幾個月,只要有人提過,我就去實際使用並感受。歸納起來,我建議一個不錯的思考架構。

任何 AI 工具,在使用之前,都該先針對「自己想完成的那件事」,思考一下以下四個等級,看看你需要多高的要求。這四個等級,由低而高分別是:

可行、可控、可重現、可負責。

可行,就是 AI 給得出一個東西。這關幾乎所有 AI 工具都過得了。但只要求「可行」的,通常就是腦力激盪。如果你想的是「讓我先大概看一下」,「先隨便撈一下,給自己一點印象、一點起頭的想法」,那幾乎任何 AI 工具都行。

可控,就是 AI 輸出的東西,如果暴走、如果幻想,你有能力初步分辨好壞,而不是照單全收。從腦力激盪,到真的要挑一個方向去做,差別就在這裡。去掉那些暴走、幻想、明顯錯誤,留下實際值得花點時間去測試的。

你如果分得出來什麼是幻想出來的、什麼是明顯錯的、什麼是不可信的,這關就過了。

多數 AI 工具都有會出錯的時候。你如果真懂這個領域,也就是有「領域知識」,通常就能分辨。最近的 AI 應用,越來越多人提到,能用得最好的,都是具有「領域知識」的人,反倒不是最懂 AI 技術或工具的人。

可重現,這在撈資料跟跑統計上特別重要。因為 methods 都得誠實交代:你用哪些資料庫做文獻搜尋(尤其統合、網絡統合類文章),你怎麼跑的統計。

你用 AI 跑,就得誠實寫自己是用 AI 跑資料搜尋跟醫學統計。但實務上,學術期刊現在對這個的接受度很低,所以你最終還是得親自去 PubMed 等資料庫搜尋一次,看是不是真的跟 AI 跑出來的一樣。你如果用 AI agent 自己寫程式或自己跑 R 做統計,最後還是得親手用醫學統計軟體再跑一次、重現一次,不管你是用 MedCalc 還是 R,都要親手確認一次。確認你要投出去的內容,真的是這些工具跑得出來的。數據圖也一樣,都得是你聲稱的工具能重現的。

科學很重視「重現」,許多科學史上的大醜聞,都是因為「無法重現」而爆開。

可負責。學術社群原則上是先相信你,你說用什麼軟體,他們就相信你真的這樣做。

但刊登公開之後,如果有人去查,發現照你陳述的方法算不出你呈現的數據,照你陳述的方法搜不出那樣的文獻流程,甚至連參考文獻格式一檢查就錯誤百出,那你要能為這個結果負責。不管是拿出有力的證據說明,還是說清楚你跟質疑者的數據為什麼不同。

腦力激盪,找出來的資料很酷,或者生出來的小軟體看起來很酷,就是在「可行」階段。

但要打造一個綁上金流、串接付費 api 的收費服務,就至少需要「可控」,也要為了之後如果被駭、被盜用、產生嚴重損失或客訴,確認自己「可負責」。

學術研究來說,初步腦力激盪只需要到「可行」的程度,可以用的工具超級多。但是真要寫成文章投稿,一定要思考到「可重現、可負責」。

而我們上課,就是直接幫各位把各種工具先篩過一遍,給負責任的建議,讓新手很快上手,又不會出包。

網路上很多爭吵,其實是在講不同的事。

有人說,AI 不能做學術,他講的可能是 AI 跑的統計跟生成的參考文獻錯誤百出。這沒錯。

另一個人批評,那是你不會用,你用 AI agent 配某某 skill,就能避開文獻出錯的問題。

這也沒錯。但初學者不見得有能力寫出一個「不會錯」的 skill,安裝別人的 skill,自己也看不懂。而出事的時候,最終還是出事的人自己負責。

AI 拓荒的年代,說法很多,情緒也很多。使用「可行、可控、可重現、可負責」,這四等級查核,是個還不錯的工具。

用這個架構你會發現,寫一個自己覺得很好玩的小遊戲給自己玩,跟寫一篇 SCI 論文壓上自己的名字去投稿讓全世界看到,這兩件事情的要求,差很遠。前者用 AI 只要「可行」就好,後者用 AI 則需要通過「可行、可控、可重現、可負責」。

用寫遊戲類比的話,後者大概就像是「寫一個好玩的小遊戲,而且測試到沒有明顯的 bug,能承受數萬人同時上線,並做到有使用者願意付費,遇到客訴時還能回應跟處理」,這樣的等級。

可行,跟可負責,是不一樣的。

(圖片為作者設計、Gemini 生成)