前沿實驗室治理(外部網站)
共用規則與閘門軟體
- 2 個 open PR
- 5 個已合併 PR
- 30 commits
- protocol 2.0.0
- CI 綠
作品 · 研究治理
「這個倉庫管理研究程序,不替自然界或數學決定真相。」
前沿實驗室把同一套方法帶到科學前沿。不因品牌給任何模型免驗證權;兩個模型同意,不算獨立驗證。工具只用 Python 標準庫,每輪預設預算 0 美元。狀態照實標示:多數問題仍是 OPEN;物理、生物、化學的結果仍在審核中;數學有 1 輪已合併的證據,但沒有宣稱解決。
這不是 benchmark,也不是題庫,是一套治理嚴格的多模型研究流程。
整個計畫建立於 2026-09-27 至 2026-09-29。
左邊是治理庫;每一列是一個實驗室,每一格是一張問題卡。◆ 標出每個實驗室的首輪問題。
| 001 | 002 | 003 | 004 | 005 | 006 | 007 | 008 | 009 | 010 | ||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 前沿實驗室治理 | 前沿數學 | 首輪 MATH-001 | MATH-002 | MATH-003 | MATH-004 | MATH-005 | MATH-006 | MATH-007 | MATH-008 | MATH-009 | MATH-010 |
| 前沿物理 | 首輪 PHYS-001 | PHYS-002 | PHYS-003 | PHYS-004 | PHYS-005 | PHYS-006 | PHYS-007 | PHYS-008 | PHYS-009 | PHYS-010 | |
| 前沿生物 | 首輪 BIO-001 | BIO-002 | BIO-003 | BIO-004 | BIO-005 | BIO-006 | BIO-007 | BIO-008 | BIO-009 | BIO-010 | |
| 前沿化學 | CHEM-001 | CHEM-002 | CHEM-003 | 首輪 CHEM-004 | CHEM-005 | CHEM-006 | CHEM-007 | CHEM-008 | CHEM-009 | CHEM-010 | |
| 前沿計算機科學 | 首輪 CS-001 | CS-002 | CS-003 | CS-004 | CS-005 | CS-006 | CS-007 | CS-008 | CS-009 | CS-010 | |
| 前沿統計學 | 首輪 STAT-001 | STAT-002 | STAT-003 | STAT-004 | STAT-005 | STAT-006 | STAT-007 | STAT-008 | STAT-009 | STAT-010 | |
| 前沿元科學 | 首輪 META-001 | META-002 | META-003 | META-004 | META-005 | META-006 | META-007 | META-008 | META-009 | META-010 | |
| 前沿社會科學 | SOC-001 | SOC-002 | SOC-003 | SOC-004 | SOC-005 | SOC-006 | SOC-007 | 首輪 SOC-008 | SOC-009 | SOC-010 | |
| 前沿材料科學 | MAT-001 | MAT-002 | 首輪 MAT-003 | MAT-004 | MAT-005 | MAT-006 | MAT-007 | MAT-008 | MAT-009 | MAT-010 | |
| 前沿天文學 | ASTRO-001 | ASTRO-002 | 首輪 ASTRO-003 | ASTRO-004 | ASTRO-005 | ASTRO-006 | ASTRO-007 | ASTRO-008 | ASTRO-009 | ASTRO-010 | |
| 前沿地球科學 | EARTH-001 | EARTH-002 | 首輪 EARTH-003 | EARTH-004 | EARTH-005 | EARTH-006 | EARTH-007 | EARTH-008 | EARTH-009 | EARTH-010 | |
| 前沿神經科學 | 首輪 NEURO-001 | NEURO-002 | NEURO-003 | NEURO-004 | NEURO-005 | NEURO-006 | NEURO-007 | NEURO-008 | NEURO-009 | NEURO-010 | |
| 前沿經濟學 | 首輪 ECON-001 | ECON-002 | ECON-003 | ECON-004 | ECON-005 | ECON-006 | ECON-007 | ECON-008 | ECON-009 | ECON-010 | |
| 前沿工程學 | ENG-001 | ENG-002 | ENG-003 | 首輪 ENG-004 | ENG-005 | ENG-006 | ENG-007 | ENG-008 | ENG-009 | ENG-010 | |
| 前沿醫學 | 首輪 MED-001 | MED-002 | MED-003 | MED-004 | MED-005 | MED-006 | MED-007 | MED-008 | MED-009 | MED-010 |
開工後 24 小時內重做四路檢索:一般、學科、解答、批評;已有外部解答就記 COMPLETED_EXTERNAL,停手。
先重現已知結果。
問題與驗證器先凍結。
每輪預設預算:30 分鐘、0 美元、100 次。
作者不能簽核自己的獨立驗證。
結果與失敗都留下;紀錄只能新增,不能刪除。
作者不合自己的工作;業主決定。
「不因品牌給任意 agent 免驗證權」
「兩個模型同意不算獨立實驗」
OPEN 只代表:本次有界檢索未找到同範圍的已確認解答。不是「未解」。
OPENPARTIALCLAIMED_RESOLVEDCOMPLETED_EXTERNALCOMPLETED_INTERNALPAUSEDRETRACTEDDRAFTADMITTEDPAUSEDCLOSED_EXTERNALFINISHED共用規則與閘門軟體
精確構造 → 反例/證書 → 形式證明
FrontierMath 與 Epoch AI 的同名 benchmark 無隸屬關係。
可重現基線 → 物理一致性 → 可區分預測
公開資料 → 基線重現 → 跨條件驗證 → 可檢驗假說
計算/實驗參照分清 → 基線重現 → 誤差與外推 → 候選假說
可執行規格 → 可重現基線 → 對抗性驗證 → 系統/演算法進步
識別條件 → finite-sample/asymptotic 保證 → 壓力測試 → 外部泛化
研究流程本身也要被實驗
measurement → identification → replication → transportability
虛擬候選 → 穩定性/可合成性 → 性質驗證 → 實驗邊界
觀測 selection function → 基線重現 → 競爭模型可區分預測 → 新資料外部驗證
觀測資料 → 物理/統計基線 → 極端/低頻事件校準 → 外部時空驗證
可區分假說 → 跨刺激/個體驗證 → 因果或干預證據 → 機制邊界
AI 經濟的 measurement → causal identification → organization/task redesign → general-equilibrium interpretation
simulation-first → 故障注入 → OOD/不確定性 → 安全邊界 → 才談部署
technical validity → external validity → clinical utility → prospective/real-world evidence
公開的 Flammenkamp 資料庫中,n = 2..76 的全部 431,008 個構形都驗證為合法;n = 75 是唯一的缺口。
problems/MATH-001/experiments/canonical_evidence/CANONICAL_FACTS.md截至 n = 71–74 與 76 的紀錄,經兩條獨立檢索路徑交叉核對;第三個獨立驗證器,以 429 例對抗測試檢查。
每一欄是一個 n(2 到 76);空著的那一欄是 n = 75。欄高沒有數值意義。
Lean 4 CI 釘在 v4.34.1;目前唯一的定理是工具鏈的煙霧測試,「不是前沿成果」。
FrontierMath 與 Epoch AI 的同名 benchmark 無隸屬關係。
這三項結果都在尚未合併的 PR 裡。
物理 PR #4:精確重現另一個模型的結構函數估計(差距 1.1e-14),記下凍結的 E3 FAIL,並撤回一個「漸近飽和」的說法。不對真實的 Navier–Stokes 湍流做任何宣稱。
生物 PR #2:撤回一個未經驗證的 PASS。找到 3,929 筆 train/test 重疊,改以 donor split 重估為 0.1616,歷史失敗保留。
化學 PR #1:加入 FreeSolv 驗證器,重現 GAFF 錨點 1.114;C4、C5 凍結門檻記為 FAIL。PR #2 修正 CRLF/LF 雜湊不符,並把 C4 標為事後(post-hoc)。
FrontierChemistry/pull/1(外部網站)FrontierChemistry/pull/2(外部網站)
frontier.py 796 行,只用標準庫指令
validatestartadmitcheck-diffcheck-pinsdecideFrontierLab-Governance/tools/frontier.py(外部網站)FrontierLab-Governance/STATUS.md(外部網站)
protocol 1.0.0 → 1.1.0 → 1.2.0 → 2.0.0(breaking)。11 個新實驗室釘 2.0.0,最早 4 個仍釘 1.0.0。
角色包括 Explorer、Verifier、Skeptic、Integrator;作者不能簽核自己的獨立驗證;業主決定合併。
11 個新實驗室第一次跑 CI 全部失敗;工具修好、重新釘版。「失敗沒有刪除或改寫成第一次就通過」。
分支保護目前只是提案,尚未啟用。
15 個實驗室裡,11 個還沒有研究輪次。
分支保護只是提案,尚未啟用。
FrontierMath 的 STATUS.md 過時,仍寫 0 輪。
16 個倉庫都還沒有 live demo(Pages 回 404)。