note01.md 通用型尖端大語言模型(Frontier LLMs)與醫療專用 AI 工具(Clinical AI tools)在醫學基準測試上的表現對比 Vishwanath, K., Alyakin, A., Ghosh, M., Hage, A., Neifert, S. N., Orillac, C., ... & Oermann, E. K. (2026). General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine, 1-5 . 這篇發表於《Nature Medicine》的研究,主要探討了通用型尖端大語言模型(Frontier LLMs) 與 醫療專用 AI 工具(Clinical AI tools)在醫學基準測試上的表現對比 。 以下為該研究的核心要點整理: 核心研究發現 通用型模型全面勝出 :無論是在基礎醫學知識、臨床醫師對齊,還是真實臨床問題的測試中,通用型的尖端 LLM(如 Gemini、GPT)表現均 優於 專門為醫療設計的 AI 工具(如 OpenEvidence、UpToDate Expert AI)。 醫療 AI 與搜尋 AI 相當 :臨床專用 AI 工具在真實臨床查詢(RCQ)中的表現,僅與常規的 Google 搜尋 AI 摘要(Google Search AI Overview)相當 。 主要結果 圖片出自 https://www.nature.com/articles/s41591-026-04431-5/figures/2 圖片說明 a. MedQA 準確率:測試模型醫學知識的基礎表現(每款模型測試 500 題)。 b. HealthBench 分數:評估模型與臨床醫生決策的對齊程度(每款模型測試 500 題)。 c. RCQ 臨床醫生綜合平均評分:採用 1 至 4 分制 。由 12 名臨床醫生中的 3 名對 100 題真實臨床查詢的生成結果進行獨立評分,排除 32 項被標記為「拒答」的配對後,各模型保留的有效樣本數分別為:Gemini (98 筆)、GPT-5.2 ...