AI 研究實驗室5 筆
主張
作為一等物件的主張,附上支持與反駁它的證據。
- 主張CLM-2026-0101F1——Token 假說若 token 是良好的普適智能工作單位,則在控制任務品質後,N_μ^eff / TokenCount 應跨模型、語言與措辭大致穩定。若跨模型、模態或表達形式劇烈漂移,「token = 智能工作單位」就退化為實作/介面的代理量。
- 主張CLM-2026-0102F2——FLOPs 充分性若 FLOPs 足以描述物理計算成本,則控制運算量後,wall time、能量、記憶體流量、互連流量與記憶體駐留不應出現大幅獨立變化。若相同 FLOPs 的工作因記憶體模式或拓撲而差異巨大,單一 FLOPs 成本模型就不足。
- 主張CLM-2026-0103F3——二元負擔假說若直接數值評分已是最低負擔、高品質的測量介面,則設計良好的二元/成對自適應協定在反應時間、一致性、流失率、預測效度或疲勞上應不具優勢。BRQM 預測至少在部分場景有優勢;可把受試者隨機分配到直接 0–10、結構化是/否與自適應成對三種格式來檢驗。
- 主張CLM-2026-0104F4——鷹架分離若鷹架不改變能力來源的結構,則 SSR ≈ 1 應在多數任務與 test-time 算力預算下成立。若大量 benchmark 品質只在多樣本、工具、驗證器或迴圈條件下出現,模型原生與系統能力的區分就具有實證必要性。第一個數據點:本地 9B 模型在三個簡單任務上 SSR = 1.0——與「原生單次已解的任務沒有落差」一致,此外沒有更多訊息,因為品質軸被格式服從性混淆。
- 主張CLM-2026-0105F5——語意中間層效用若語意中間層 N_μ 沒有測量價值,那麼加入它不應比直接的「物理成本 → 品質」模型更能解釋或預測跨架構效率、錯誤路徑、鷹架增益或任務遷移。μI 本身必須通過這個預測/解釋效用檢驗,否則就該被修正或淘汰。