公開說明頁 · 無需通行碼
「讓 AI 扮演選民」是這兩年最熱門的民意研究新做法。我們在 2026 年 6 月用當時的模型試過,結論是輸給傳統統計。四個月後模型升級到 Claude Opus 5.5,我們用同一套考題重考一次,再加兩個新實驗。答案很一致:AI 很會看人,但說話誇張。
做法是這樣的:告訴 AI「你是一位 45 歲、大學畢業、住台北的女性」,問她會投給誰。造出成千上萬個這樣的虛擬選民,加總起來,就是一份不用打電話的「民調」。國外有團隊這樣做,國內也有機構推出類似產品。
吸引人的地方很明顯:便宜、快、可以問傳統民調問不到的假設題。但它有一個根本問題——AI 說的話,怎麼知道對不對?
Sim Taipei 的做法是:每一個 AI 的回答,都拿真實選舉結果或真實調查去對答案。2026 年 6 月我們用當時的 Opus 4.8 考了四次,四次都輸給一個簡單得多的統計做法:把上一場開票的里級結構凍結,再用民調把全市水位釘對。現在模型換代,值得再考一次。下面把「用真實資料學出規律」的統計模型簡稱為統計公式。
我們把 419 種匿名的選民樣貌交給 AI——只說年齡、性別、婚姻、學歷、省籍,不給地名、不提是哪一場選舉——請它猜這種人投藍或投綠。再按台北 456 個里各自的人口組成拼起來,跟 2024、2020 兩次總統大選的真實開票比。
這裡要分開看兩件事。第一是排序:哪些里比較綠、哪些比較藍,AI 排得對不對。第二是水位:全市整體到底多綠,AI 猜得準不準。
| Opus 4.8(2026/6) | Opus 5.5(2026/10) | |
|---|---|---|
| 里的排序跟 2024 實際的吻合程度 (1 = 完全一致,0 = 毫無關係) | 0.660 | 0.661 |
| 里的排序跟 2020 實際的吻合程度 | 0.703 | 0.706 |
| 猜全市綠營佔藍綠的比例 (2024 實際 50.4%,2020 實際 56.3%) | 50.9% | 48.5% |
排序幾乎完全一樣。唯一的差別是新模型把全市猜得更藍一點,所以碰到綠營大勝的 2020 年,誤差反而更大。
第一個實驗用的是虛擬選民。第二個實驗換成真人:政大選舉研究中心的 TEDS 2024 調查,在 2024 總統大選前訪問了一批人「打算投誰」,選後回頭再問同一批人「實際投了誰」。大部分人沒改,大約每 15 人有 1 人換了。
我們把每個人選前的回答(年齡、學歷、省籍、統獨立場、支持政黨的強弱、打算投誰)交給 AI,請它扮演這個人,猜他最後投給誰。判斷輸贏的標準,在跑 AI 之前就寫好並存進版本紀錄,事後不能改。
同時測兩個問題:給 AI 看民調,會不會更準?給它看這個人自己回答的「覺得誰會贏、最不希望誰贏」(判斷棄保的線索),會不會更準?
| 挑出「會換人的人」的準度 (0.5 = 亂猜,1 = 全對) | 以為會換人的比例 (實際 6.8%) | |
|---|---|---|
| 統計公式(拿到跟 AI 一樣的資訊) | 0.830 | 7.9% |
| Opus 5.5 · 基本資料 | 0.828 | 12.0% |
| Opus 5.5 · 再加民調 | 0.832 | 11.8% |
| Opus 5.5 · 再加「覺得誰會贏、最不希望誰贏」 | 0.822 | 11.7% |
| Opus 4.8 · 同上(對照) | 0.812 | 15.7% |
這個「誇大」不是我們獨有的發現。已有論文實測,AI 會把真實只有 4–11 個百分點的群體差距放大到 47.6 個百分點(arXiv 2412.15291)。AI 腦中的選民,比真實的選民更有戲劇性。
知道 AI 的長處和短處後,第三個實驗照這個分工來做:AI 只負責判斷「誰講話,誰聽得進去」,「會有多少人改變」交給真實資料。
從 10 月 6 日模擬到 11 月 28 日投票日,共 8 週。
| AI 判斷誰聽誰 | 對照:每個人影響力都一樣 | |
|---|---|---|
| 8 週內換了邊的人(兩個方向加總) | 3.25% | 3.41% |
| 全市整體移動 | −0.05 個百分點 | +0.01 個百分點 |
人確實在動,但往兩個方向動,加起來就抵掉了。每一群都只是往「身邊的人」靠近一點點,變化都在 1.5 個百分點以內。AI 的判斷跟「人人一樣」比,只多造成 0.06 個百分點的差別。
AI 給的「誰聽誰」表裡,最明顯的一件事是同溫層:每一群聽自己人平均 8.9 分,聽別群平均 4.0 分。它也會寫理由,例如年輕、偏民眾黨的一群,最聽得進同齡朋友「講房租、薪水這些生活的苦」。這類理由讀起來很像真的——但我們沒有真實資料可以驗證,所以只能當作假說。
這也是 Sim Taipei 一直以來的分工:數字交給真實資料和民調,AI 負責解釋和說故事。這次又得到同樣的結論,而且用的是目前最新的模型。