AI 研究實驗室4 筆
基準
每個基準都說明它測什麼,也說明它沒有測什麼。
- 基準BEN-2026-0001PACC 微型實驗室協定 v0.1(凍結門檻)從 v0.1 到 v0.13 原封重用的預登記判決規則:E0 純度、held-out 表徵距離 D_R = E[JS(Φ(S_N), S_P)] ≤ 0.05、更新交換 D_U ≤ 0.05、離流形干預 D_I ≤ 0.08、行動一致度 ≥ 0.85、真實映射必須勝過的 shuffled-target 負控制、設計獨立規則(一致度 ≥ 0.999 且 R² ≥ 0.995 即視為同一家族)、判決等級 0–3,以及至少三個獨立收斂家族的強 PACC-A 門檻。
- 基準BEN-2026-0003PACC-LLM 混合 A/B/C benchmark三種條件跑在完全相同的候選池上:A 純生成器、B 硬驗證器、C PACC runtime(另有事後的 D「elastic」)。v0.1:7 類 × 28 題 × 8 池 × 112 候選(1,568 個共享池實例)。指標:明示硬約束遵守、衍生一致性、軟意圖滿足、長程保持、原始與有效新穎度、pattern entropy。v0.2:16 個手寫自然語言任務、相同計費預算、只有對條件盲的評審看得到 gold rubric。
- 基準BEN-2026-0002AER-0 架構比較套件(R1–R6)逐輪成長的決定性可執行比較:R1——兩個事實(一穩定、一在第 8 與 16 小時改變)、17 個模擬小時內 8 次查詢,基線 B1 無狀態/B2 固定 6 小時 TTL/B3 記憶 + 工具/B4 事件驅動複合 agent;R3——分散政策 vs 集中式應用 gate vs AER-ECT,比 provenance、stale write、audit 與依賴綁定;R4——N ∈ {1, 4, 16, 64} 個 caller × 6 條規則的政策拓撲縮放;R5——五個威脅層上的十種繞過情境;R6——連貫的整庫偽造、anchor 竄改、有/無可信 head 的前綴截斷、fail-closed anchor、孤兒 anchor、adapter 一致性。
- 基準BEN-2026-0101XA-02——A0→A5 鷹架響應的 30 題 pilot 任務包30 題——數學 10、程式 10、約束 10——含公開任務檔(題目、輸出契約、預先登記的品質投影)、絕不可進入模型上下文的私有參考檔、確定性評分器與 30/30 自測。數學與約束題回一個 JSON 物件;程式題回 Python 原始碼、以隱藏測試評分,且除非在外部沙箱明確啟用,否則拒絕執行程式。套件自己的說法:不是通用智能 benchmark,而是 Experiment A 下量測鷹架響應的受控儀器。