SIM NEW TAIPEI · FAQ

常見問題

這一頁把方法從頭講一遍,不用任何專業術語。 如果你只想知道「這到底是不是民調」「地形和水位是什麼」「準不準」,看這一頁就夠了。

1,032新北市全部的里(29 個行政區)
0 份問卷。沒有訪問過任何一個人
8 場拿來當考古題的真實選舉
26 題本頁問答

這是什麼

這是民調嗎?

不是。沒有抽樣、沒有電話訪問、沒有問卷,沒有訪問過任何一個人

它做的是:把「過去每一次開票,每個里各投給誰」的地理結構,乘上「現在的民調量到全市整體挺誰」, 推算出每個里這次可能的比例。民調是它的原料,不是它的產品。

那它到底在算什麼?

新北市有 1,032 個里,它算的是每一個里大概有多少比例的人會投給誰。

民調給的是全市一個數字,這套做法把那一個數字翻成 1,032 個。 如果要用傳統抽樣做到同樣細的程度,得做大約 103 萬份訪問——實務上不可能。

為什麼要做這個?

為了證明一件事:預測可以在開票前就講死,開票後公開對答案。

每一波預測發布的當下,就把整份檔案存檔鎖住,日期時間留有紀錄,發布後不再修改。 11 月 28 日開票後,一個里一個里公開對帳,錯了也照寫。 這個專案真正想留下的不是那個預測數字,是一套敢公開對答案的做法。

誰做的?

孫文學校 AI 民意與數據研究中心(Sun Yat-sen School AI Research Center)。 獨立製作與維護,未受任何政黨、候選人、競選團隊或其代理人委託、贊助或資助

地形與水位:整套方法只有這兩個零件

什麼是「地形」?

把上一次全市大選的開票結果攤開到每一個里,得到「這個里比全市平均藍多少、綠多少」。 這是 1,032 個數字,描述的是里跟里之間誰高誰低

地形不預測誰贏。它只回答一件事:如果情勢變化,哪些里會先變色。 這次用的是 2024 年總統大選新北市每一個里的開票結果。

什麼是「水位」?

只有一個數字:這一場選舉,全市整體挺誰、挺到什麼程度。

候選人個人魅力、全國政治氣氛、突發事件、棄保,全部混在這一個數字裡。 這個數字沒辦法從歷史資料推出來,只能靠當下的民調量。

地形跟水位怎麼合起來?

用退潮來想最好懂。

2024 年總統大選,民進黨在新北全市大約拿到 52.5%。 但這次市長選舉的民調顯示,蘇巧慧目前的水位大概在 46.8%—— 比 2024 年低了約 5.7 個百分點

所以做法是:把 2024 年那張地圖整張往下調 5.7 個百分點。 原本某個里是 60%,現在算 54.3%;原本是 45% 的,現在算 39.3%。

關鍵

每個里都減一樣的數,所以誰高誰低完全沒變,變的只是整體水位高度。

就像退潮:水面整個降下去,但哪座山高、哪座山矮一點都沒變。 差別在於——原本剛好露出水面的那幾座,現在露得更多;原本剛好淹在水下的,還是在水下。 而卡在水面附近的那些,就是這次的勝負關鍵。

為什麼是「照抄上一次開票」,不是用年齡學歷去推?

兩條路都實際跑過,比出來照抄贏 3 到 6 倍

先說「誤差分數」怎麼看:拿每個里的預測值減掉實際開票值,平方之後平均。 平方是為了讓「錯很大」比「錯一點」更嚴重。數字越小越好,0 代表完全命中。 因為平方過,數字看起來很小不好體會,換算回百分點比較直觀:

考古題用年齡、學歷、所得去推照抄上一次開票
2022 市長平均每個里差約 7.5 個百分點平均每個里差約 4.2 個百分點
2024 總統平均每個里差約 8.2 個百分點平均每個里差約 3.2 個百分點

為什麼照抄會贏?因為里跟里之間的政治高低,是地方派系、族群、產業、幾十年遷徙史 慢慢沉積出來的結果。年齡、性別、婚姻、學歷、所得那幾個數字抓不住這些東西。 而上一次開票,已經把它們全部記錄下來了

水位動一點,會差多少?

水位每移動 1 個百分點,大約有 50 到 58 個里會換邊。

原因是新北很多里都擠在 50% 附近(有 324 個里落在 47%~53% 這個膠著帶)。 所以水位只要動一點點,地圖上的顏色看起來就會變很多。

資料與工具

資料從哪裡來?

以下是推估用到的資料,全部公開可查:

來源內容用途
中央選舉委員會2014–2024 新北市每個里的歷次開票結果(8 場)地形 + 考古題對答案
內政部戶政司新北市每個里的年齡、性別、婚姻、教育人數統計拼出人口骨架
財政部新北市 1,032 個里的綜合所得稅中位數結構特徵
內政部國土測繪中心新北市村里界圖畫地圖用的底圖
各民調機構公開發布的報告凱達格蘭、TVBS、震傳媒×山水、新台灣國策智庫、鉅聞天下等當期水位

全部都是公開的,沒有爬蟲、沒有來路不明的資料、沒有任何個人資料。 完整的資料來源清單見本站揭露聲明

「338 萬個虛擬選民」是編出來的嗎?

不是編造,是拼圖

政府公布的是每個里「20–29 歲有幾人」「大專以上有幾人」這種各自獨立的總數, 但沒有公布「20–29 歲而且大專以上」有幾人。做法是反覆按比例調整, 湊出一份同時符合所有已公布總數的完整人口表: 1,032 個里、121,647 種人口組合、合計 3,381,092 人, 加總回去對得上戶籍統計,一人不差。

沒有任何一筆對應到真實的某個人。它是統計上的拼圖,不是名單。

用什麼工具做的?

程式用 Python 寫,不依賴任何外部套件,只用最基本的內建功能。 寫程式的過程用 Claude(Anthropic 的 AI 助理)輔助。

分工要講清楚

AI 用在寫程式、建模型上,不參與投票推估的計算。 也就是說,AI 幫忙把這套算法寫出來、幫忙檢查有沒有寫錯; 但「這個里會投給誰」那個數字,是開票紀錄和民調算出來的,AI 沒有插手。

同一套程式換個城市參數就能跑台北。已經拿台北重跑驗證過: 16 支程式跑出來的結果,跟原本台北的檔案小數點後每一位都一模一樣。

這 16 支裡面,只有 1 支會用到 AI——那一支負責的是文字敘述的部分, 不在預測的計算路徑上。真正算出「哪個里會投給誰」的那 15 支,完全沒有 AI 參與。

那 AI 在這個專案裡到底扮演什麼角色?

這是這個專案最值得講的一段,因為它是一個失敗紀錄

台北那邊最原始的構想,其實就是「用 AI 生成虛擬市民,讓 AI 猜他們會投給誰」。 這個構想聽起來很新潮,結果被自己的驗證推翻了:把答案蓋起來考了四次, 四次都輸,而且是同一個方向的輸。表現最好的那一次 AI 推估, 誤差還是「單純複製上一次開票」這種笨方法的 3.5 倍

同一時期國際上的研究撞到同一面牆。一篇 2024 年的論文(編號 arXiv:2412.15291) 用大量樣本證明:AI 模擬會把群體之間的差距嚴重誇大—— 現實中兩群人差 4 到 11 個百分點的事,AI 模擬出來會變成差 47.6 個百分點, 放大 4 到 10 倍

所以新北從第一天就直接套用這條結論,沒有再花時間重踩一次同樣的坑

現在 AI 的位置

幫忙寫程式、幫忙建立模型、幫忙整理與檢查。 它不負責推估任何一個里會投給誰。

會不會用到個人資料?

不會。所有原料都是政府公開統計公開的開票結果。 虛擬選民是統計拼圖,不對應任何真實個人,也沒有任何一筆是真人的資料。

準確度怎麼驗證

怎麼知道這套做法準不準?

過去已經開完票的選舉當考古題。規則是「只准用更早的資料去猜後面的」: 要預測的那一場,它的開票結果從頭到尾沒有進過計算,等答案算完了才拿出來對。

為什麼要跟「笨方法」比?

因為光說「猜對八成」沒有意義——如果隨便猜也有八成,那這套做法就沒價值。所以一定要贏兩個笨方法: 全市平均法(假設 1,032 個里長得一模一樣,每個里都猜全市平均)與 五五波法(每個里都猜五五波)。

過關標準有兩條:誤差要比全市平均法好一成以上, 而且方向猜對的比例不能比它差。

考古題這套做法全市平均法
2024 總統平均每個里差約 3.2 個百分點平均每個里差約 12.1 個百分點
2022 市長平均每個里差約 4.2 個百分點平均每個里差約 9.6 個百分點

四場考古題,考幾次、過幾次?

四場獨立驗證,3 場過關、1 場沒過。四場「方向猜對」的比例落在 77.6% 到 97.1% 之間。

「方向猜對」的意思是:這個里最後是投藍的人多、還是投綠的人多,有沒有猜對邊。 它跟前面講的「平均每個里差幾個百分點」是兩種不同的看法——一個看有沒有站對邊, 一個看差多遠。

考古題(拿哪一場去猜)方向猜對全市平均法判定
2024 總統 ← 拿 2020 總統推86.2%69.0%
2020 總統 ← 拿 2024 總統推90.3%84.4%
2018 市長 ← 拿 2022 市長推77.6%76.2%
2022 市長 ← 拿 2018 市長推97.1%98.0%沒過

再說一次過關標準:誤差要比全市平均法好一成以上,而且方向猜對的比例不能比它差, 兩條要同時成立。誤差那一條,四場全部通過;掉下來的只有最後一場的方向猜對比例。

這張表考的是哪一條路線?

是「用年齡、學歷、所得去推」那條——它是專門拿來反覆考試、 檢驗方法有沒有價值的。而實際拿去做 2026 預測的是「照抄上一次開票」那條, 在有跑對照的兩場都更好:2024 總統平均每個里差 3.2 對 8.2 個百分點、 2022 市長 4.2 對 7.5 個百分點。但在 2022 市長那場,它一樣沒過方向這一關 (96.9% 對 98.0%)。兩條路線在同一場踢到同一塊鐵板。

有一場沒過關,為什麼要寫出來?

因為不寫出來就沒有資格談準確度。

2022 市長那場沒過關。原因值得講清楚:那場是侯友宜 62 比 38 的大勝, 「全部押藍」這種完全沒有資訊的猜法,在 1,032 個里裡就對了 98.0%, 這套做法 97.1%,方向反而輸了 0.9 個百分點。

會這樣是因為那場綠營過半的里只剩 21 個。這種一面倒的場次, 只要無腦全部押藍,幾乎就自動答對——反而是願意去指認那 21 個里的做法容易被扣分。

要小心的地方

大勝的場次,方向猜對率天生就虛高,不能只看它。 同一場如果看誤差大小,這套做法平均每個里差約 7.5 個百分點、 全市平均法差約 9.6 個百分點,是明確贏的。

為什麼地圖上有些里畫斜線?

那是「比較沒把握的里」,而且不是人工圈出來的,是算出來的: 拿兩場考古題算每個里的誤差,取最差的 10%(103 個里)標示出來。

它們集中在瑞芳、平溪、金山、萬里、坪林這些山區跟海線的區。那些里常常只有幾百人, 投票行為由地方派系、宗族、部落網絡主導,跟年齡、學歷、所得幾乎沒關係

因為人少,它們對「誰當選」影響很小;但對「地圖畫得準不準」影響很大,所以標出來。

這一波預測說了什麼

結論是什麼?

李四川 53.2%、蘇巧慧 46.8%(兩人對決的比例)。1,032 個里裡,蘇巧慧領先 464 個里。 完整內容見賽前預測預測地圖

「領先但不安全」是什麼意思?

翻盤只需要水位往蘇巧慧方向移動 3.2 個百分點。 而列入計算的 5 份民調,最高的跟最低的就差了 4.42 個百分點—— 分歧比翻盤所需的幅度還大。

而且那 5 份裡,4 份說李四川領先、1 份說蘇巧慧領先。 單獨拿其中任何一份當水位,蘇巧慧過半的里數會在 409 到 626 之間擺盪。

這份預測最該記住的一句

這場選舉的不確定性,幾乎全部集中在水位那一格,地形反而很穩。 所以它不是「李四川穩了」,而是「以現有民調來看,李四川站在有利的一側,但這場選舉還很接近」。

如果預測錯了怎麼辦?

已經先把話講死,寫了四條開票後可以直接抓的宣稱。11 月 28 日開票後逐條對帳, 而且會分開檢驗是水位錯了還是地形錯了——這兩件事失準的意義完全不同。

資料公開性、法規、界線

你們用的資料,別人查得到嗎?

全部查得到。開票結果在中央選舉委員會、人口統計在內政部戶政司、 所得資料在財政部、地圖底圖在內政部國土測繪中心;民調全部是各機構自己公開發布的報告, 逐筆列出日期、機構、樣本數、誤差。

任何人都可以拿同樣的公開資料重跑一次,看看是不是得到一樣的答案。

另外有一條規則寫死在程式裡:政黨自己委託的民調不列入計算。 這一波依這條刷掉兩筆——民進黨內部民調一筆、國民黨黨團委託一筆。 兩筆剛好各自對委託方有利、分別落在最高和最低兩端。 規則是在看到數字之前就先寫死的,兩邊同一條標準。

它會不會被拿去操作選舉?

界線先講清楚:它算的是傾向比例和相對結構,不是保證誰當選。 市長這種比拚個人魅力的選舉,本來就是這套做法的弱項——候選人因素會蓋過人口結構, 所以市長只做情境推演,不賣水晶球。

選罷法第 53 條是什麼?11 月 18 日之後還看得到嗎?

看不到。依公職人員選舉罷免法第 53 條,投票日前 10 日起至投票時間截止, 任何人不得發布、報導、散布、評論或引述具民意調查外觀的選舉資料。 中選會公告投票日為 2026 年 11 月 28 日,所以法定黑箱期是 2026-11-18 凌晨起,到 11-28 投票截止

本站的作法

期間本站全部頁面自動下架封存, 改導向封存說明頁,直到投票結束。這是寫死在伺服器裡、每 5 分鐘自己檢查一次的機制, 不靠人記得去關。這個作法比法律要求的更保守。

本段為工程與產品視角的合規設計說明,非法律意見; 確切法律適用以中央選舉委員會函釋及法院見解為準。完整說明見揭露聲明

它不能做什麼?

沒有當期民調就定不了水位。只能畫出相對地形,定不了高度。

山區跟海線的里可信度明顯較低(見上一節最後一題)。

不做里長預測。1,032 個里裡有 783 個里的里長選舉根本沒有藍綠得票, 現有的計分方式不適用。

假設是兩人對決。如果選戰結構改變(第三個人參選、藍白整合破局、任一方退選), 這一波預測全部作廢,要重新設定再發一波。