SIM TAIPEI · 實驗筆記 · 2026-10-06

AI 模型變強了,
扮演選民變準了嗎?

公開說明頁 · 無需通行碼

「讓 AI 扮演選民」是這兩年最熱門的民意研究新做法。我們在 2026 年 6 月用當時的模型試過,結論是輸給傳統統計。四個月後模型升級到 Claude Opus 5.5,我們用同一套考題重考一次,再加兩個新實驗。答案很一致:AI 很會看人,但說話誇張。

00 · 先講結論

三句話

01 · 為什麼要重考

AI 扮演選民,是怎麼一回事

做法是這樣的:告訴 AI「你是一位 45 歲、大學畢業、住台北的女性」,問她會投給誰。造出成千上萬個這樣的虛擬選民,加總起來,就是一份不用打電話的「民調」。國外有團隊這樣做,國內也有機構推出類似產品。

吸引人的地方很明顯:便宜、快、可以問傳統民調問不到的假設題。但它有一個根本問題——AI 說的話,怎麼知道對不對?

Sim Taipei 的做法是:每一個 AI 的回答,都拿真實選舉結果或真實調查去對答案。2026 年 6 月我們用當時的 Opus 4.8 考了四次,四次都輸給一個簡單得多的統計做法:把上一場開票的里級結構凍結,再用民調把全市水位釘對。現在模型換代,值得再考一次。下面把「用真實資料學出規律」的統計模型簡稱為統計公式。

02 · 實驗一

猜每個里會投藍還是綠

我們把 419 種匿名的選民樣貌交給 AI——只說年齡、性別、婚姻、學歷、省籍,不給地名、不提是哪一場選舉——請它猜這種人投藍或投綠。再按台北 456 個里各自的人口組成拼起來,跟 2024、2020 兩次總統大選的真實開票比。

這裡要分開看兩件事。第一是排序:哪些里比較綠、哪些比較藍,AI 排得對不對。第二是水位:全市整體到底多綠,AI 猜得準不準。

Opus 4.8(2026/6)Opus 5.5(2026/10)
里的排序跟 2024 實際的吻合程度
(1 = 完全一致,0 = 毫無關係)
0.6600.661
里的排序跟 2020 實際的吻合程度0.7030.706
猜全市綠營佔藍綠的比例
(2024 實際 50.4%,2020 實際 56.3%)
50.9%48.5%

排序幾乎完全一樣。唯一的差別是新模型把全市猜得更藍一點,所以碰到綠營大勝的 2020 年,誤差反而更大。

白話:只給五個人口條件,能推出來的東西就這麼多。換一個更聰明的人來推,也推不出更多。要更準,得補資料,不是換模型。
03 · 實驗二

猜真實選民,誰會在最後一個月換人投

第一個實驗用的是虛擬選民。第二個實驗換成真人:政大選舉研究中心的 TEDS 2024 調查,在 2024 總統大選前訪問了一批人「打算投誰」,選後回頭再問同一批人「實際投了誰」。大部分人沒改,大約每 15 人有 1 人換了。

我們把每個人選前的回答(年齡、學歷、省籍、統獨立場、支持政黨的強弱、打算投誰)交給 AI,請它扮演這個人,猜他最後投給誰。判斷輸贏的標準,在跑 AI 之前就寫好並存進版本紀錄,事後不能改。

同時測兩個問題:給 AI 看民調,會不會更準?給它看這個人自己回答的「覺得誰會贏、最不希望誰贏」(判斷棄保的線索),會不會更準?

挑出「會換人的人」的準度
(0.5 = 亂猜,1 = 全對)
以為會換人的比例
(實際 6.8%)
統計公式(拿到跟 AI 一樣的資訊)0.8307.9%
Opus 5.5 · 基本資料0.82812.0%
Opus 5.5 · 再加民調0.83211.8%
Opus 5.5 · 再加「覺得誰會贏、最不希望誰贏」0.82211.7%
Opus 4.8 · 同上(對照)0.81215.7%
一個要先講的漏洞:AI 知道 2024 年的開票結果,所以「整體最後誰贏」它可能是背出來的。但它不認識這 1,266 位受訪者,「哪一個人會換」背不出來——這也是我們把「挑人準度」當主要指標的原因。

這個「誇大」不是我們獨有的發現。已有論文實測,AI 會把真實只有 4–11 個百分點的群體差距放大到 47.6 個百分點(arXiv 2412.15291)。AI 腦中的選民,比真實的選民更有戲劇性。

04 · 實驗三

讓 983 種台北人格互相影響到投票日

知道 AI 的長處和短處後,第三個實驗照這個分工來做:AI 只負責判斷「誰講話,誰聽得進去」,「會有多少人改變」交給真實資料。

從 10 月 6 日模擬到 11 月 28 日投票日,共 8 週。

AI 判斷誰聽誰對照:每個人影響力都一樣
8 週內換了邊的人(兩個方向加總)3.25%3.41%
全市整體移動−0.05 個百分點+0.01 個百分點

人確實在動,但往兩個方向動,加起來就抵掉了。每一群都只是往「身邊的人」靠近一點點,變化都在 1.5 個百分點以內。AI 的判斷跟「人人一樣」比,只多造成 0.06 個百分點的差別。

AI 給的「誰聽誰」表裡,最明顯的一件事是同溫層:每一群聽自己人平均 8.9 分,聽別群平均 4.0 分。它也會寫理由,例如年輕、偏民眾黨的一群,最聽得進同齡朋友「講房租、薪水這些生活的苦」。這類理由讀起來很像真的——但我們沒有真實資料可以驗證,所以只能當作假說。

這是展示,不是預測。「誰碰得到誰」沒有資料;AI 的「誰聽誰」表沒有標準答案;換人比例借用 2024 總統選舉最後一個月,套到 2026 市長選舉。能說的只有一件事:在真實量到的變動幅度內,人與人之間的影響很難讓全市移動超過 1 個百分點。
05 · 這告訴我們什麼

AI 是翻譯員,不是水晶球

  1. 別期待等下一代模型就會變準。瓶頸在資料。同樣的線索,換更強的模型,答案幾乎一樣。
  2. 問 AI「誰」和「為什麼」,別問它「多少」。它挑人挑得跟統計一樣好,還能講出理由;但只要讓它決定幅度,數字就會被放大。任何直接拿 AI 虛擬選民的百分比當民調用的做法,都該先回答:你怎麼處理放大?
  3. 選舉的勝負在整體水位,不在鄰里閒聊。真實資料裡,個人會變,但雙向抵銷;模擬裡也一樣。會讓整個城市一起移動的,是重大事件、動員和投票率。

這也是 Sim Taipei 一直以來的分工:數字交給真實資料和民調,AI 負責解釋和說故事。這次又得到同樣的結論,而且用的是目前最新的模型。

06 · 還沒回答的

這些實驗測不到的事