跳到主要內容
命理先生

方法論與準確度研究

首頁寫著「紅隊審查的準確度研究,方法論全程公開」。這一頁是那句話的出處:我們用什麼方法量「準」、量出來的數字是多少、那些數字不能拿來說什麼,以及排盤引擎到目前為止修掉了哪些錯。

這一頁要回答的問題

命理網站最難驗證的一件事就是「準」。使用者讀完一份解讀覺得說中了六七成,這個感覺通常是真的——但它可能來自三個完全不同的來源:命盤真的排對了、話講得夠廣所以誰讀都中、或者那句話根本來自提示詞模板,換誰的盤都會出現。

這三者用感覺分不開,只能用實驗分開。我們的第一個實驗(編號 01,2026 年 8 月 5 日完成)就是要把它們拆開。結果對我們自己並不好看,以下把設計、數字與限制一起寫出來。

怎麼量:換盤對照

巴納姆效應指的是人會把泛用的人格描述當成專屬於自己的。要檢驗一份解讀裡有多少是這種成分,公認的做法是換盤對照:拿別人的命盤生成的解讀,讓當事人對照自己的人生評分。如果別人的命書也能拿到差不多的分數,那個分數量到的就不是排盤。

  1. 真盤組:一位願意提供完整生平的受試者,生辰經本站排盤,由三個不同世代的模型各生成一份解讀。
  2. 誘餌組:三個虛構命例,性別相同、年齡相差三歲以內、出生地相同、提問相同,只有生辰時刻不同;經同一套線上排盤、同一個模型、同一組參數生成解讀。刻意讓誘餌在人口學上盡量貼近受試者,這樣量到的才是排盤本身的增益。
  3. 盲化:六份解讀去掉模型與身分標記、隨機編號,由不知情的抽取者拆成 309 條可驗證的生活主張並去掉命理術語,混池洗牌後才交給評分者。
  4. 評分:逐條對照受試者生平標記命中或未中,同時評估每條主張的「普適性」——這句話有多少人會覺得說中。

設計上有兩條硬規定:寫提示詞的人不參與評分;生成解讀的那一側從頭到尾看不到受試者的生平,送進模型的欄位只有使用者本來就會輸入的那幾項(生辰、性別、出生地、提問)。

實驗 01 量到了什麼

實驗 01 六份解讀的命中率、高特異命中數與套話占比
解讀身分模型計分條數命中率高特異命中套話占比
R2真盤A3183.9%078.6%
R6真盤B3479.4%072.5%
R4真盤C4162.2%057.6%
R3誘餌C4061.3%159.6%
R5誘餌C4267.9%162.5%
R7誘餌C3768.9%160.4%

真盤三份合計 74.1%,誘餌三份合計 66.0%,表面差距 8.1 個百分點。但真盤組含三個模型、誘餌組只有一個,這個差距混進了寫作風格——模型 A 與 B 的套話占比高達七成以上,講得越空泛越容易「中」。

把模型控制住之後:同一個模型的真盤 62.2%,誘餌平均 66.0%。真盤沒有贏過誘餌。這是在那個版本的管線下、n = 1 的條件下量到的結果。

再看「低普適性且命中」的主張——說中了、而且不是誰聽都準的那種——真盤三份合計 0 條,誘餌 3 條。全池的普適性分佈嚴重偏向套話:高普適性的主張約占六到七成,真正特異的只有約 3%。

紅隊審查時另外找到一條更硬的證據:提示詞模板裡的示例場景被六份解讀近乎原樣複誦,同一句「準話」不管排哪個盤都會出現,因為它來自模板本身而不是盤面。這條發現後來直接導致我們把模板裡的 13 條示例句換成抽象指令。

一句話總結:在那個版本的管線下,受試者感覺到的「準六七成」,拿別人的命書來對照他的人生也拿得到 66%。

這些數字不能拿來說什麼

  • n = 1。只有一位受試者的生平可對照,所有結論都是「這個人身上的觀察」,不能當成通則。
  • 「排盤沒有增益」不成立,正確的說法是「未偵測到」。同模型比較只有一份真盤解讀,差距 −3.8 個百分點的 95% 信賴區間約落在 −21 到 +13 個百分點之間。這個設計連「真盤好十個百分點」都偵測不到,所以它證明不了增益是零——它只證明這把尺不夠細。
  • 評分是自動評分程式做的,不是本人。對照生平文字判斷命中,跟當事人自己的感受是兩把不同的尺;生平沒寫到的事一律不計分,六份解讀各有 15% 到 38% 的主張因此沒有進到分母。受試者本人逐條盲評還在等填寫,那才是黃金標準。
  • 「高特異命中 0 條」是量尺問題,不只是產品問題。全池特異主張只占約 3%,而越特異的主張越容易落在生平沒寫的地方。在合池比率下,真盤那 106 條一條都沒中的機率本來就有約四分之一——0 條與誘餌的 3 條在統計上分不開。目前的量尺量不到「真的算到了」,這句話比「算不到」誠實。
  • 素材出自舊版管線。實驗全部的解讀都生成於一個提示觸發 bug 修好之前(見下方修復清單第三項),該版本的比較不能外推到現在的產品。
  • 這個實驗只評到回溯性的描述。預測未來的主張在匯池前就被濾掉了,那一塊要一年後回訪才評得了——而那正是使用者最在意的部分。

我們把這一段留在這裡,是因為只列好數字的方法論頁沒有意義。

紅隊審查

實驗做完之後交給一個獨立的審查角色,任務只有一個:挑方法的毛病。審查結果是 2 個 Critical、5 個 Major、6 個 Minor。

其中兩個主結論被判定「表述超出證據強度」並強制降級改寫:原本寫的「排盤帶來的增益接近零」改成「未偵測到增益」,「準感完全來自寫作風格」的「完全」兩個字被撤掉。審查同時對原表述下了否決——不得以原本的說法寫進產品文案或後續實驗的前提。這一頁是照審定後的版本寫的。

審查也列出了三項對報告自己不利的設計偏差,其中最重的一項是:抽取主張時把西元年換算成年齡,等於替誘餌抹掉了對不上的年份,這一步本身就偏向「真盤不贏」。我們照建議做了敏感度分析——把全部 83 條年齡錨定的主張剔除後重算,巴納姆差距從 8.1% 變成 8.2%,結論方向沒有改變。

已經修掉的錯

排盤引擎的正確性優先於提示詞的措辭。以下是研究過程中查出並已修復的問題,日期為修復上線日。

  1. 01真太陽時的均時差公式相位錯置2026-08-05

    程式用了太陽赤緯式的相位去配均時差的係數,對天文年曆的四個錨點是 0/4 吻合,全年平均誤差 13.2 分鐘、最大 28.7 分鐘。以台北出生推算,約 11% 的出生時刻會被排到錯的時支——時支一錯,紫微的命宮跟著整張盤位移。

  2. 02真太陽時校正跨午夜時日期沒有進退位2026-08-05

    校正後從 23:50 變成隔日 00:10 時,程式只把分鐘繞回去、日期不動,日柱因此停在前一天。命中的人不多(大約是午夜前後二十分鐘出生的),但一旦命中,日主換人,整張盤與所有解讀全部作廢。

  3. 03紫微福德宮化忌的提示從來沒有觸發過2026-08-05

    四化的值存的是單字「忌」,比對時卻寫成「化忌」,永遠不會相等。這條規則存在一年多、觸發次數是零,該收到精神層面提醒的命盤一次都沒收到。

  4. 04命理師提示被包在紫微區塊裡2026-08-05

    五條提示規則整段包在「有沒有紫微盤」的條件內,導致不知道出生時辰的使用者連純八字的規則都拿不到——資訊最少、最需要保守提醒的一類輸入,反而一則警告都沒有。

  5. 05六爻外卦的納甲索引錯位2026-08-29

    外卦三爻取值取到了內卦的位置,全 64 卦、192 個外爻的地支全部是錯的,六親錯 128 個(66.7%),52 卦憑空少掉一個六親——取用神因此可能從「現於卦中」變成「不上卦」,吉凶方向可能相反。同一次修正補上了此前從未計算的世應。修正經《卜筮正宗》的納甲裝卦歌逐卦覆核,並加了一條不依賴任何外部資料的回歸測試:全 64 卦中必須恰好有十卦六沖。

  6. 06身強判定把印星的藏干算成「根」2026-08-29

    傳統上「有根」是判斷能不能承擔財官的分界,而根指的是日主自身的氣,印是「生」不是「根」。混在一起計分會單向把弱盤說成強盤,下游的敘事就變成「宜求財、承受得起風險」。修正後根氣與印助分開計分,並產出一個明確的「有無實根」旗標。

  7. 07極端偏枯的命盤停止硬給喜忌2026-08-29

    從格一類的命盤喜忌與常規扶抑相反,對它套常規判斷會把用神當忌神講。修正後這類盤不再輸出用神忌神清單,改為標示需要保留判斷。這條的設計目標不是判對從格,而是讓演算法在沒有能力給答案的地方停止硬給答案。

  8. 08「財多身弱」的觸發條件過鬆又漏報2026-08-29

    原本只要天干出現任何一顆財星、分數夠低就打出最重的警語;反過來,財星全藏在地支、成局得令的典型盤反而不會觸發。修正後改為四條件判準,警語強度隨證據強度分級。

  9. 09用神的表述降級2026-08-29

    本站取用神只用扶抑一法,沒有做格局相神、調候、病藥與通關。原本的輸出把單一流派的答案講得像沒有異議的事實。修正後會載明取法,並在強弱得分靠近切換點時標示臨界、改用保留語氣。

  10. 10提示詞模板去種子化2026-08-29

    13 條會被跨盤複誦的示例句換成抽象指令。這是紅隊審查的直接產物——那些句子不管排哪個盤都會出現,因為它們來自模板而不是盤面。

  11. 11措辭鐵則與表述降級互相牴觸2026-08-29

    一條全域規則禁止使用「可能/或許」,另一條規則卻要求臨界盤用保留語氣——最需要保留語氣的盤剛好是衝突最強的盤,等於降級被自己撤銷。已改為禁令加開例外。

  12. 12合盤的五行統計與單人不同源2026-08-29

    同一張盤在兩條產品線被告知不同的五行數字。已統一為加權版本(藏干本氣 1.0、中氣 0.5、餘氣 0.3)。

  13. 13解讀被截斷2026-08-30

    把模型的思考深度調到最高之後,一半的輸出預算花在看不到的思考上,可見的字數反而是三檔裡最少的,而且斷在句中、整段大運缺席。改回中檔之後才是唯一能完整寫完的設定。

  14. 14出生地對不上經度表,真太陽時等於沒校正2026-08-30

    個人資料存的是「新北市」,而經度表的鍵是「新北」,精確查表落空就完全沒有校正。實測當時 22 位填了生辰的使用者裡只有 1 位查得到。同一次補上了經度表原本缺少的彰化、南投、雲林三縣。

  15. 15交節只比對到日期,節氣時刻也差幾分鐘2026-09-25

    年柱、月柱只看出生日是不是交節那一天,交節當天、交節時刻之前出生的人被排進下一個月,立春當天則連年柱一起錯。節氣時刻用的是低精度公式,對照紫金山天文台 1950 至 2025 年公布值平均差 3.6 分鐘、最大 12.8 分鐘,有 2 個節氣連日期都錯。改用高精度太陽位置演算法後,與公布值的差距都在 1 分鐘內,年柱、月柱、大運起運與六爻月建都改為比對到分鐘。受影響的主要是節氣當天出生的人:交節前出生的,月柱(立春則連年柱)會改回前一個月。

  16. 16紫微主星的廟旺表與典籍不符2026-09-25

    十四主星在十二宮的亮度表與《紫微斗數全書》的廟旺利陷總表逐格比對,168 格錯了 127 格,例如太陽在子宮應為「陷」,程式標成「平」。已改用全書總表,與主流開源排盤軟體 iztro 逐格一致。所有紫微命盤上標示的廟旺與送進解讀的亮度資料都會隨之改變。

這份清單也說明了一件事:這些錯在被找出來之前,站上的解讀已經照著錯的盤講了一段時間。

還沒解決的問題

  • 受試者本人的盲評尚未完成。本人逐條標記與自動評分之間的差距本身就是要看的數據。
  • 樣本仍是 n = 1。要把它變成 3 到 5 位,需要願意提供完整生平與生辰的受試者。
  • 第二個實驗尚未啟動。題目是提示詞的火候(給結論、只指向、還是不給),前置條件是去種子化定案與用修復後的管線重新取基線。
  • 每一次影響輸出的改動都會切斷可比性。目前的規則是修正前後的紀錄不混在同一個統計裡,切分點逐條記錄。六爻的納甲修正、提示詞的措辭修正、模型設定的變更各有一條切分點,下一次實驗的基線一律從最後一次切分之後重新擷取。這讓進度變慢,但混池比較出來的數字沒有意義。
  • 八字排盤仍有已知未處理的項目。沖刑合會對根氣的影響、三合三會成局、調候。這些在目前的扶抑框架內表達不出來,我們選擇載明而不是假裝有做。

你可以在站上驗證的部分

解讀回饋。每一份解讀跑完之後都會出現一張回饋卡,問的是「這次解讀準嗎」而不是「滿不滿意」——後者會混進文筆與篇幅,而那正是實驗 01 要拆開的東西。評分一到十分,訪客也能填。這是準確度資料唯一的長期來源,中途出錯或按停的解讀不會出現回饋卡,避免把「服務有沒有壞」混進「算得準不準」。

流派載明。命理沒有唯一解,同一張盤在不同流派會得到不同答案。本站採用的選擇都寫在各工具頁上:紫微四化取現代通行的中州派、八字採夜子時制(23:00 之後日柱不進位)、藏干權重固定且未採人元司令分野。你在別處看到不一樣的結果,多半是流派差異而不是算錯。

排了什麼、沒排什麼。八字排盤、紫微斗數、六爻問卦三頁的最後一節,各自列出程式真的算得出來的項目與刻意沒做的項目。解讀不會憑空推衍沒有排出來的東西。

參考文獻

本頁使用的「巴納姆效應」與「冷讀」定義取自以下文獻,實驗設計也參照其中的典範:

  • Forer, B. R. (1949). The fallacy of personal validation: A classroom demonstration of gullibility. Journal of Abnormal and Social Psychology, 44(1), 118–123.
  • Sundberg, N. D. (1955). The acceptability of “fake” versus “bona fide” personality test interpretations. Journal of Abnormal and Social Psychology, 50, 145–147.
  • Dickson, D. H., & Kelly, I. W. (1985). The “Barnum effect” in personality assessment: A review of the literature. Psychological Reports, 57(2), 367–382.
  • Hyman, R. (1977). Cold reading: How to convince strangers that you know all about them. The Zetetic (Skeptical Inquirer), 1(2), 18–37.

本頁內容依研究進度更新,最後更新於 2026 年 8 月 30 日。實驗報告、紅隊審查意見與命理裁決文件保存在專案的研究資料夾內,本頁所有數字均出自其中;涉及受試者個人生平的原始資料不公開。解讀內容供自我探索與參考之用,不構成醫療、法律或財務建議。