AI推薦給你的資料來源是什麼?
AI的引用來源主要是英文網路內容,學術資料只佔小部份,AI回答很可能會反映出資料原有的偏見,或綜合了網路資料的見解來解讀學術資源,但是沒有標示出每項觀點的出處。
根據2025年3月至8月間超過3600 萬次Google AI 概覽(AI overviews)與4600 萬次引用的分析,「維基百科、YouTube、Google生態系資料(Google的部落格、商城等)、Reddit和Amazon」合計佔所有引用量的 38%。不同AI會有各自偏好的資料來源,ChatGPT偏好引用維基百科(佔引用來源的47.9%),Bing Chat通常引用較少來源且很常引用WikiHow。AI搜尋相較相較傳統搜尋更能提供多媒體(如youtube)的資料來源,且有機會發掘到以往搜尋結果中的冷門網頁。
AI 搜尋工具經常「很自信地給出錯誤答案」
「Search engines in the ai era: a qualitative understanding to the false promise of factual and verifiable source-cited responses in llm-based search」招募 21 位不同學術和專業背景的專家(已完成或正在攻讀博士學位),讓他們在其擅長的複雜查詢上評估 AI 搜尋表現,指出三類問題值得大家注意:
回答正確性:內容過於籠統且不充分、反映提問者偏見、答案過於自信、口吻幼稚、喜歡討好、缺乏批判性思考
引用來源支持度:引用正確但來源錯誤、選擇性呈現部分觀點、無法辨別為何引用某些來源
資料來源品質:資料來源太少、來源不夠權威或過時、提供重複來源、列出未引用的來源
Tow數位新聞中心測試了8種AI搜尋工具:多數 AI 都很自信地給出錯誤答案(很少使用「看起來」「有可能」「或許」),即使是付費模型也不代表會降低錯誤率,且無法正確連結到原始出處;即使出版商不允許 Perplexity 爬蟲爬取資料,卻仍能從 Perplexity 找到應付費才能使用的《國家地理》文章,代表其未遵守 robots.txt 協定。
AI 答案快速查證測試
這個資訊超乎常識嗎? AI 生成內容與你已知的基本常識完全不符時,就應查證。
AI 給的內容有明確數據,但沒有來源? AI 給出具體數據(百分比、金額、人口數)卻未提來源,就應查證。可直接問 AI「這個數據的來源是什麼」,若給不出文獻或連結是假的,就應查證。
AI 生成的資訊與你的直覺矛盾嗎? 答案讓你感覺「不太對勁」時,可用 Google 查關鍵字看是否有可信來源支持。
AI 給出的內容太過絕對或極端? AI 使用「永遠」「100%」「不可能」等極端表述時應查證。
AI 給的來源「你從沒聽過」? 若 AI 提供的文獻、網站、新聞來源你從未聽過或查不到,很可能是 AI 捏造的。
風險分級檢查
高風險(必須檢查):涉及法律、醫療、財務的具體建議;統計數據與研究結論,一定要回到權威來源查證。
中風險(抽樣檢查):一般性論述、背景說明,可挑幾筆抽樣核對。
AI 搜尋同時改變了「讀者」與「內容生產者」兩端
讀者端:皮尤研究中心(Pew Research)於2025年分析900名美國成年人的線上行為資料,58% 在 2025 年 3 月至少使用一次 Google AI 摘要;使用 AI 摘要的人會更快結束瀏覽其他資訊、且傾向不檢視資料出處網站,新聞媒體網站如「華盛頓郵報、NBC新聞」等的流量皆大幅下降。
內容生產者端:AI 造成創作者的網頁拜訪下降可能影響其收益,當創作者意識到自己公開在網路上的資料非自願成為訓練資料後,可能會設定robots.txt 禁止使用 AI 爬蟲的指令,更讓 AI 搜尋結果無法涵蓋所有資料。同時,AI生成的網頁也越來越多,2025年4月Ahrefd分析了90萬個新的英文網頁,估計其中有74.2%包含AI生成內容;這些內容有些是刻意營造的假評論、有些是內容農場,無法確認作者是否好好檢查後才發布,卻都可能成為未來 AI 搜尋與摘要的資料來源,形成「AI 生成內容 → 成為 AI 訓練資料 → 再生成更多 AI 內容」的循環風險。
如何增加被AI搜尋到的機會?
以前商家為了讓產品在網路上更容易被客戶找到,會做 SEO(搜尋引擎優化),藉由良好的網站架構或關鍵字設定增加曝光度。現在則開始要做 GEO(生成式引擎優化),針對生成式 AI 的資料引用特性來調整網站設計。Google 生態系的 AI 仍會基於原本的 Google 搜尋機制,因此以往的 SEO 仍有作用;然而 ChatGPT的搜尋是搭配Bing,若網站設計沒有考量到 Bing 的可見度,就可能減少在 ChatGPT 回答中的曝光。
如果您是想要增加自己研究曝光的研究者或機構,可掌握以下5點:語意精確(頁面聚焦主題清晰且有事實基礎)、結構化資料實作(結構標記實現機器可讀內容)、權威領域訊號(品牌辨識度、主題權威性與引用模式)、內容新鮮度(定期更新以維持檢索增強系統的相關性)、事實準確性(經驗證的資訊提升推理模型中的信心分數)。
Google現行的搜尋品質評分標準EEAT代表「經驗、專業知識、權威、信任」。要提升後三項,可採取良好的寫作風格及網站架構、標示資料來源出處、成為其他權威網站的引用來源;「經驗」這項是 AI 時代的新考量—人類對於情境的理解說明與特殊問題的解答方式,比起 AI 生成內容的概括性答案更能通過標準。原創性研究、專屬獨特資料、專家評論會吸引AI的引用,但 AI 會避免引用與大眾見解相差太遠的資訊(這也是下指令時需要請 AI 提供反面觀點的原因);AI 選擇來源時也會考慮新穎性,因此需定期更新網頁並明確標示最後更新時間。
研究者還可注意機器能讀懂的身分與作品連結設定,如 ORCID、DOI;經營網頁時注意是否能被 AI 爬取(如使用Markdown格式);並為研究成果增加「結構式摘要、常見問答、不同學科的關鍵字或同義詞、主張與證據對照表、資料來源與限制」這些機器會喜歡的形式。
學術研究都會有文獻回顧的環節,用以展現及整理前人已發現、尚未解答、相互矛盾等等的研究成果,以顯示過往的研究缺口及自己研究的貢獻與價值。不同領域對於文獻回顧所需使用的資料類型及回顧的完整度可能有不同標準,擬定政策或產業報告時也往往會有類似的資料蒐集過程。
許多時候我們找不到資料,並不是資料不存在,而是沒有使用正確策略。在尚未完整蒐集前人資料的情況下提出自己的研究假說與論證,有可能會重複他人的研究,而且前人可能有一些類似的經驗可以參考,若有看到就有機會節省一些時間。
在傳統資料庫檢索的做法中,若發現資料不足,往往會先檢視是否使用的資料庫確實涵蓋足夠所需資料來源,像是現在需要史料就不應在期刊資料庫查詢。接著,會檢視使用的關鍵字組合,像是有沒有包含同義詞、是否能用布林邏輯將這些關鍵字妥善相連(如:"climate change" OR "global warming" OR "environmental shift")。在此情況下,要判斷資料是否飽和就是透過轉換關鍵字,當所有關鍵字都查過一輪,都沒有新發現時,就代表資料已找得差不多。
另一種做法是,從一篇重點研究的參考文獻中延伸閱讀,就可以在不用界定關鍵字的情況下看到與此主題相關的資料。若使用這種方法發現關鍵字查詢遺漏的大量資料,那往往代表自己起初定義的關鍵字組合需要調整,可以根據引用或被引用文章出現的重要關鍵字進行新一輪的檢索。
在AI出現前,我們可以使用維基百科或綜述文章(Review article)獲得某些主題術語的定義及第一輪閱讀的資料,AI出現後能讓我們加速一開始對研究問題的理解,用互動提問的方式更快掌握關鍵字及修正研究方向。但是,要注意AI的訓練資料內容有先天限制,現階段尚無法代表所有人類知識且有幻覺,建議要與其他資料蒐尋管道共同使用。
您可以參考以下對於資料查詢管道的比較,同時發揮不同資料來源的強處與避免誤用:
學生:
課程作業或論文:如大學生或碩士生寫作學期報告、畢業論文或專題報告,需要回顧文獻來熟悉主題、支持論點或找出研究缺口。
熟悉領域與學習:為了了解學科內的經典研究或最新進展,例如初學者透過回顧來建立理論框架,或在課堂討論中分析既有文獻。
情境通常受限於時間與資源,重點在於廣泛但不需極度全面的蒐集。
研究者:
研究提案或論文部分:如博士生或學者撰寫研究計畫、期刊論文或書籍章節,回顧文獻作為引言或方法論基礎,用來定位自身研究在既有知識中的位置。例如,在申請經費時,需證明研究填補了文獻缺口。
獨立出版回顧文章:研究者可能專門寫作回顧性論文,如系統性回顧,用來總結領域進展、指出矛盾或提出未來方向。
發展理論或方法:在進行原創研究前,回顧文獻以合成多個視角、批判分析或建構新框架,例如在跨學科項目中整合不同領域的發現。
情境更強調深度與嚴謹性,常涉及團隊合作或長期追蹤最新出版物。
人文科學(e.g., 文學、歷史、哲學)
情境:學生常為論文分析經典文本或文化現象;研究者則回顧以建構敘事或批判理論,如歷史學者回顧檔案以重新詮釋事件。
飽和與適當:多為敘述性或整合性回顧,飽和依主題重複(e.g., 無新解釋出現);適當需涵蓋經典與現代來源(20-50篇),強調質性深度而非量。
停下來:當主要史料或理論已涵蓋、無新視角時;資源限於檔案存取。
查詢方式:使用JSTOR或MLA International Bibliography;特殊:主題詞如"postmodernism",結合歷史時期(e.g., "Victorian era" AND "literature");強調書籍與專著搜索,非僅期刊。
社會科學(e.g., 心理學、社會學、教育)
情境:學生為課程報告回顧社會現象,如教育學生分析「遠距學習影響」;研究者則為政策建議或理論模型,如心理學者合成壓力研究。
飽和與適當:常敘述性或範圍審視,飽和當人口或情境模式穩定(e.g., 代碼飽和);適當涵蓋定性/定量混和(50-100篇),評估文化多樣性。
停下來:重複社會理論出現,或滿足研究問題(如無新變項);考慮倫理因素如人口代表性。
查詢方式:PsycINFO或ERIC;特殊:控制詞彙如APA Thesaurus,結合人口過濾(e.g., "adolescent" AND "mental health" NOT "clinical");使用前向引用追蹤最新社會趨勢。
自然科學(e.g., 物理、化學、環境科學)
情境:學生為實驗報告回顧基礎理論;研究者則為新發現定位,如環境科學者回顧氣候模型以提出預測。
飽和與適當:多系統性或元分析,飽和依量化指標(e.g., 效果大小穩定);適當需高影響力期刊(50-200篇),確保實驗重現性。
停下來:當新文獻不改變結論,或搜索Scopus後無新高引用文章;時間敏感,如追蹤最新數據。
查詢方式:Web of Science或ScienceDirect;特殊:化學式或數學符號搜索(e.g., "CO2 emissions" AND "modeling");使用OR擴大同義詞(e.g., "global warming" OR "climate variability"),結合年限過濾最新進展。
醫學/健康科學(e.g., 醫學、護理、公衛)
情境:學生為臨床報告回顧治療效果;研究者則為證據基礎醫學,如系統回顧疫苗效能以支持政策。
飽和與適當:偏系統性或元分析,飽和嚴格(e.g., Cochrane指南,無新隨機試驗);適當涵蓋RCT(randomized controlled trials,數百篇),評估偏誤(e.g., funnel plot)。
停下來:協議定義的搜索結束,或無新臨床試驗註冊;考慮倫理如患者安全。
查詢方式:PubMed或Cochrane Library;特殊:MeSH詞彙(e.g., "Hypertension/therapy"),PICO框架(Patient, Intervention, Comparison, Outcome);灰色文獻如臨床試驗註冊(ClinicalTrials.gov),限制出版類型為"randomized controlled trial"。
每個人的LLM/ChatBot會因為長久互動跟記憶對話,可能會被訓練得不一樣,即使使用相同指令,也可能有不同答案。
現在有層出不窮的指令教學,建議學習背後的方法與思考方式,並根據自己的任務需求來彈性調整。
基礎指令原則
對齊知識:先確認AI有正確解讀自己提出的資訊、且具備回答問題的知識,才請他做接下來的動作。一開始可以先用自己熟悉的主題與任務測是,較能判斷AI是否有回答錯誤的地方。
充分資訊+具體要求:越清楚自己的目的、擁有越多背景資訊,就能提供更多目前已知訊息和想法在指令內形成具體要求。具體要求可以是字數、文體風格、表格呈現方式等。
設定角色:說明自己或是AI扮演的角色、面對的情境、須完成的任務,有了更多上下文脈絡,就更能給出需要的資訊。
舉例:舉例說明自己想要的內容、或是請AI舉例說明。
追問:先釐清自己的任務與需求,再將大問題拆成小問題分開提問、試著轉換不同說法/觀點/語言提問、詢問AI回答的原因/依據、挑戰AI給的答案、請AI進一步說明、請AI列出正反面觀點、請AI跳出框架思考。
探索:有時候可以故意只拋出簡單問題、或是請AI忘記所有之前的資訊,避免AI僅在自己提供的訊息框架中回答而錯過探索新知的機會。
避免在指令內有明顯偏見/偏好,這會影響AI生成的結果。
設定一個專門任務的對話串,在該對話串中可以用多個Prompt訓練出希望他翻譯、摘要等任務,之後就直接在對話串內提問。
同時以多種管道驗證AI提供的資訊,從其他來源獲得不同資訊後可再與AI繼續互動,甚至拿其它AI的回答來提出質疑。
許多人會在網路上分享自己的指令設計,甚至有許多研究在測試什麼樣的指令能有更佳的效果,您可以針對您的專業領域去蒐集這些指令並測試修改。您也可以請AI幫忙設計指令或是修改指令。請參考Grok「根據研究者經驗推薦的指令」(Grok善於搜尋社群媒體討論區上的交流紀錄)、GPT5.4思考模式提供的「研究者不同情境可用指令與注意事項」、Gemini Pro Deep Research做的「Deep Research指令設計與注意事項報告」。
網路上有許多指令框架可以參考,像是CLEAR框架
研究問題導向
Context(背景):簡述研究問題和目標。
舉例:「我正在研究 AI 在醫療診斷中的應用及其倫理挑戰,目標是了解技術進展和潛在風險,預計要發展成我的碩士論文。」
Limits(限制):指定時間範圍、語言、來源類型。
舉例:「只蒐集 2020 年後經過同儕審查的英文學術文章,盡可能從 PubMed、Google Scholar 或 IEEE Xplore 等可靠來源查詢。排除新聞或部落格。」
Expectations(期望):描述輸出格式(如總結、引用清單)。
舉例:「請列出 8 篇真實存在且具代表性的論文,對每篇提供 300 字摘要並說明品質評估依據,並用 APA 格式引用。」
Assessment(評估):要求 AI 評估資料品質和代表性。
舉例:「請確保資料多樣性,避免單一觀點;如果有偏差,請說明。」
Refinement(精煉):鼓勵 AI 提問或建議改進。
舉例:「請指出我可以追問的方向或提供的細節。」
輸出品質導向
Concise(簡潔):使用清晰、簡單的語言,刪除無關的詞彙與細節,突顯最重要的訊息。
舉例:「請告訴我二次世界大戰的成因、主要事件以及與一次世界大戰的關聯性」改成「請列出二次世界大戰的五個原因與三個重要戰爭」
Logical(邏輯):確保資訊邏輯流暢,且概念間的關係清晰。可以在指令中說明步驟。
舉例:「請說明空氣汙染對環境造成的三個影響、請解釋規律運動對於健康的益處」「請先完整蒐集近三年關於台北市空氣汙染的新聞報導,再整理空氣汙染的類別,接著分析可能的應對方式」
Explicit(明確):提供明確的輸出格式,具體說明尋要的資訊類型與傳達方式。可以指定角色、提供範例、設定語氣。
舉例:「提供一次世界大戰的完整摘要,強調主要原因、主要戰爭、對於全球政治的長遠影響」「請你扮演教導比較政治的教授,根據我的文本內容以及我提供的評分標準,幫我修改成更具有學術寫作風格的5000字產出,同時提供修改的原因及未來的寫作建議」
Adaptive(適應):根據AI生成結果,持續變換各種提示與措詞,嘗試將任務拆分。
Reflective(反思):持續評估AI生成結果並進一步互動,以產生後續深度分析。
降低AI幻覺的指令 (不代表能完全沒有幻覺!)
您可以在指令中加入以下要求:
請在回答中列出關鍵主張,每個關鍵主張都要有來源依據,盡可能標示出出自來源的位置與資料連結,並說明為什麼可以支持
如果具有爭議,請提供多方證據並分開整理
請坦承說出資料不足與不確定,詳細說明回答內容的限制
請嚴謹的區分事實證據與推論,提供每個證據的信心程度與標示出推論段落
請適時說明我的指令中忽略或具有偏見、誤導的部分
也可以參考以下指令作法:
提供值得信賴、有權威的資料來源,或是提供具體細節、背景資訊、詳細場景說明,請AI基於這些資訊來回答,或據此補充相關資料。
從一個大問題開始,分解成可以單獨檢查的相關小問題,逐步檢查、確認、解決。
先提出一般性問題,再增加具體性,每個步驟都要以前一步當成邏輯基礎。
請AI審查自己的初步回答,請AI找出自己的錯誤或缺失的細節。
針對AI的回答提供具體回饋,指導AI改進方向,並請AI記住自己的改善偏好。
從Prompt到Context到Agent
現在AI回答的品質,不再只取決於「一句Prompt寫得好不好」,也受到目前對話、上傳文件、記憶、搜尋到的資訊、可用工具以及任務流程影響。因此,面對複雜任務時,比起不斷修改一句「完美Prompt」,更重要的是思考:「AI現在看得到什麼資料?記住了什麼?能使用什麼工具?應該按照什麼流程完成任務?」
當AI進一步具備 Agent 功能後,還要思考它「可以做什麼」及「被允許存取什麼」。可以依序思考:「我要它做什麼 → 它需要知道什麼 → 去哪裡取得資料 → 可以使用哪些工具 → 哪些動作需要我確認」。
建議學習資源
Open AI Prompt engineering 、Claude Prompt engineering (內有google表單分步驟教學、可觀看此影片了解指令好壞的差異與指令範例)、Gemini提示設計策略、Prompt Engineering Guide (部分章節有中文版)、University of Sydney-AI in Education (提供不同學科領域的Prompt範例)。
數位時代有一系列指令教學文章可以參考:OpenAI釋出Prompt免費懶人包、Gemini 3官方提示詞指南、逆向提示詞(Reverse Prompting)、GPT-5 Optimizer指令優化器、NotebookLM進階提示詞、Notion《100 個 AI 代理人使用情境》指南。
您也可以閱讀圖書館電子書「ChatGPT實用提示兵法 : 人人都能學會的提示工程」。