EveMissLab
AI 研究實驗室
AI 系統的理論、實驗、模型、資料與證據。
EveMissLab 把 AI 當作計算的、架構的、表徵的、且自主的研究對象 —— 從理論一路做到可重現的證據。
- 進行中的研究
- 7
- 進行中的實驗
- 1
- 資料集
- 2
- 基準
- 4
- 研究計畫
- 2
快照 AI-SNAPSHOT-v0.1-fe85b9694a45 · 124 個研究物件 · 499 條關係 · 產生於 2026-09-11 · index.json
目前的研究
全部 (7) →- 研究RES-2026-0002PACC 猜想——非概率 primitive 會不會收斂到概率表象?把 canonical state 與更新規則都不需要概率分布、Bayesian posterior 或抽樣的系統,放進與精確 Bayesian 參考相同的證據整合任務中,量測低複雜度、只在訓練集擬合的映射能否把它們的狀態送到 Bayesian 狀態、映射是否與更新交換並在干預下存活、以及獨立設計的家族是否收斂——四層階梯(PACC-B/R/D/A)與預先登記的否證條件。
- 研究RES-2026-0004PACC 式 runtime 用在語言模型上:推理、意圖與創造廣度把候選選擇包進 canonical 硬約束/衍生約束的 commit 空間,會改變生成器的產出嗎?合成的 A/B/C 見證(純生成器/硬驗證器/PACC runtime)顯示衍生一致性與滿足約束的新穎度上升、軟偏好契合略降,以及一個可由事後「elastic」探索策略恢復的創造廣度塌縮。真實語言模型版本的 benchmark 已有驗證過、fail-closed 的 harness,但尚未執行。
- 研究RES-2026-0001自適應認識系統的盲推導只從第一原理出發——時間異質的世界知識、canonical 符號狀態、自適應表示空間、能力記憶、載體中立計算——十一篇系列推導出一個候選架構,再面對推導本身冒出的不舒服問題:它為什麼越來越像現代複合 AI?差異有沒有任何一部分能活到 runtime 裡?
- 研究RES-2026-0003認識論治理能不能活過實作?AER-0 架構比較六輪把 AER-0 runtime 與越來越強的基線比較——無狀態重算、固定 TTL、記憶 + 工具、事件驅動複合 agent、LangGraph 1.2.11(僅 source-grounded)、最後是一個允許做得跟 AER 一樣好的集中式應用層 gate。每一輪都把主張收窄:從「AER 不一樣」收到「AER 把認識論治理從應用慣例提升為 runtime 層的 canonical-write 邊界」,附有界中介與外部簽章真實性見證,並明確不主張獨特的計算能力。
- 研究RES-2026-0103能力線——拿掉 LOOP 還剩多少智能,以及統一的智能事件第 09–10 篇與 v0.2 Experiment A 儀器。系統 =(模型,鷹架向量);單次品質 Q_SP 與完整系統品質 Q_F 給出鷹架存活率 SSR = Q_SP/Q_F、依賴率 SDR、鷹架成本倍率 SCM 與受控消融階梯 A0…A5 上的邊際鷹架產率——全部要跟物理額外成本一起讀,因為 LOOP 不是作弊,隱藏成本才是。第 10 篇把品質、語意工作、物理計算與鷹架封裝成 canonical intelligence event,在「不過早純量化」規則下用 Pareto 前沿比較系統,並固定最低報告標準。這條線的第一個真實數據點是 2026-09-03 在本地 9B 模型上的 pilot。
- 研究RES-2026-0101執行與物理線——一個答案在回合、語意工作、能量與計算時空上的代價第 01–05 篇。把聊天介面的「一輪」拆成使用者回合、生成軌跡、模型呼叫、外部 LOOP、重試、選擇與物理執行軌跡;提出最小智能語意執行單位 μI 作為物理原語與任務成果之間缺失的中間層;借用神經科學的跨層、潛變量推斷、群體編碼與因果擾動方法;把能量分型為 gross/baseline/marginal/attributed 並要求宣告邊界,Landauer 只是下界不是價格;並以物理成本向量與「向量優先」的計算時空及其拓撲取代 FLOPs。
- 理論THY-2026-0005PACC 猜想——四層收斂階梯PACC-B(行為:D_B ≤ ε)、PACC-R(表徵:在 held-out 任務上仍有效的低複雜度映射 Φ: S_N → S_P,K(Φ) ≤ κ)、PACC-D(動力學:Φ∘U_N ≈ U_P∘Φ)與 PACC-A(≥3 個獨立設計的架構吸引子)。猜想預先登記自己的失敗模式 F1–F6——行為分歧、無低複雜度映射、更新圖失敗、干預分歧、規模下架構分歧、概率特有優勢持續——讓「相似」與「概率」不能事後重新定義。
- 理論THY-2026-0001非對稱時空張力:時間異質的世界知識把非對稱性從邊的方向或權重,提升到節點與關係的有效時間尺度。每個節點帶有穩定性、資訊衰減率、更新張力、系統影響度與局部有效時間;刷新由張力、外部擾動、資訊年齡、變化速度與事件相關性觸發,而不是一個全域時鐘——穩定知識沉睡、快變知識高頻更新、低頻高影響的基礎節點一旦改變就觸發大範圍依賴重算。
- 理論THY-2026-0002Canonical 符號狀態與 candidate → verify → commit 權限自然語言是輸入與輸出,永遠不是 canonical state。文字經解析、正規化、語義綁定與來源標記,轉成可比較、可驗證的符號結構;輸出從該狀態 render 出來。模型與工具的輸出是候選證據,只有 committer 在 verifier 通過與 expected-version 檢查後才能改動 canonical state。
- 理論THY-2026-0003智能架構吸引子不同的第一原理可能編譯成同一小族計算形態。比較框架區分六個差異層級——程式碼、primitive、計算軌跡、架構狀態語義、可觀測行為、資源效率——並追問誰持有狀態、什麼可以改寫 canonical state、動態結構在低成本映射下是否保持。系列以固定的判決表結束:Distinct Advantage、Operational Convergence、Behavioral Equivalence Only、Inconclusive、Architecture Worse。
- 理論THY-2026-0004概率不等於貝葉斯;貝葉斯不能自我授權前提一個系統可以是隨機的、概率的或概率形狀的,卻沒有做 Bayesian conditionalization;也可以看起來像 Bayesian,卻沒有真正的 prior、likelihood 或 posterior。一套分層詞彙(stochastic、probabilistic、Bayesian-like、exact、approximate、generalized Bayesian)與「Bayesian authenticity test」檢查一次更新是實質 Bayesian 還是事後被重新描述成 Bayesian;而更新規則本身——prior、likelihood、假設空間——需要一個 Bayes 公式給不出的授權(第 9–10 篇)。
- 理論THY-2026-0006AER-ECT:強制的認識論 commit 交易邊界每一次 canonical knowledge 的改動都必須通過一個強制的認識論交易邊界,綁定 claim、evidence、provenance、有效時間與觀察時間、expected version、認識論算子、驗證政策、權限、依賴與 refresh policy:Propose → Verify → Authorize → CompareAndCommit → BindDependencies → Audit。零件都不新(truth maintenance、transaction logic、PROV、bitemporal state、PDP/PEP);假說是這個 tuple 在 canonical write 邊界上是強制的——一個類 reference-monitor 的認識論邊界,而非已證明 tamperproof 的 monitor。
主張
全部 (5) →- 主張CLM-2026-0101F1——Token 假說若 token 是良好的普適智能工作單位,則在控制任務品質後,N_μ^eff / TokenCount 應跨模型、語言與措辭大致穩定。若跨模型、模態或表達形式劇烈漂移,「token = 智能工作單位」就退化為實作/介面的代理量。
- 主張CLM-2026-0102F2——FLOPs 充分性若 FLOPs 足以描述物理計算成本,則控制運算量後,wall time、能量、記憶體流量、互連流量與記憶體駐留不應出現大幅獨立變化。若相同 FLOPs 的工作因記憶體模式或拓撲而差異巨大,單一 FLOPs 成本模型就不足。
- 主張CLM-2026-0103F3——二元負擔假說若直接數值評分已是最低負擔、高品質的測量介面,則設計良好的二元/成對自適應協定在反應時間、一致性、流失率、預測效度或疲勞上應不具優勢。BRQM 預測至少在部分場景有優勢;可把受試者隨機分配到直接 0–10、結構化是/否與自適應成對三種格式來檢驗。
- 主張CLM-2026-0104F4——鷹架分離若鷹架不改變能力來源的結構,則 SSR ≈ 1 應在多數任務與 test-time 算力預算下成立。若大量 benchmark 品質只在多樣本、工具、驗證器或迴圈條件下出現,模型原生與系統能力的區分就具有實證必要性。第一個數據點:本地 9B 模型在三個簡單任務上 SSR = 1.0——與「原生單次已解的任務沒有落差」一致,此外沒有更多訊息,因為品質軸被格式服從性混淆。
- 主張CLM-2026-0105F5——語意中間層效用若語意中間層 N_μ 沒有測量價值,那麼加入它不應比直接的「物理成本 → 品質」模型更能解釋或預測跨架構效率、錯誤路徑、鷹架增益或任務遷移。μI 本身必須通過這個預測/解釋效用檢驗,否則就該被修正或淘汰。
進行中的實驗
全部 (1) →最新結果
全部 (18) →- 結果RST-2026-0014真實本地模型 A/B/C 表(Qwythos-9B-v2)v0.2 協定第一次在真實語言模型上執行——本地開放權重 9B(Qwythos-9B-v2、Q4_K_M、Ollama、關閉思考)同時當生成器、選擇器與評審;16 題 × 2 次 × 4 候選,380 次呼叫,每條件 32 筆。PACC runtime(C)在 supersession 對齊(相對 B +0.031、相對 A +0.097)與修復成功率(+0.070/+0.094)上升——正是 canonical intent 編譯步驟存在的那兩個軸;衍生一致性(+0.011)與意圖持續(−0.002)沒有動;有效新穎度略低(相對 B −0.045)。多數逐題配對是平手,因為 9B 評審在接近 1.0 處飽和;每題只重複兩次,評審的自由文字 pattern 標籤從不重複,所以創造廣度量不出來。三個條件在 69 % 的題 × 次配對中選了不同的候選。
- 結果RST-2026-0015第二次執行:條件間無可靠差異;廣度未縮減(64 筆)C 相對 B:supersession +0.0005、修復 -0.0125、衍生一致性 -0.0075、意圖 -0.0114、有效新穎度 -0.0187;標籤無關廣度:群熵 C 0.923/A 0.909/B 0.864。
- 結果RST-2026-0016第三次執行:開啟思考後 PACC runtime 的有效新穎度與修復上升;治理持平;廣度未縮減(32 筆)C 相對 B:有效新穎度 +0.0687、修復 +0.0153、語義新穎度 +0.0166、衍生一致性 -0.0063、意圖 -0.0053、supersession -0.0059;C 相對 A:有效新穎度 +0.0375、修復 +0.0466;標籤無關廣度比 C 1.047/A 0.960/B 0.973。
- 結果RST-2026-0007v0.2 對抗幾何:N3 收斂、N2 越過表徵門檻N3 held-out JS 0.014454(Level 3);N2 held-out JS 0.053327 > 0.05(Level 1);N0/N1 0.023921(Level 3)。
- 結果RST-2026-0008v0.4:潛在依賴座標無法重建四個系統在每個 seed 下依賴座標通過數皆為 0;高相關下真實 JS ≈ 0.0398 低於 0.05 絕對門檻,但不比 shuffled(≈ 0.0400)或 constant(≈ 0.0397)好。
- 結果RST-2026-0009v0.6:組合座標 4/4、直接映射 0/4每個家族與幾何下組合潛在 JS 都 ≪ shuffled/constant 且 ≪ 弄壞的組合(例如中相關 N0:0.003603 vs 0.061508 vs 0.058196)。
資料與基準
資料 · 2
- 資料集DAT-2026-0001PACC 合成證據世界決定性生成的微型環境:4 個隱藏假設 × 6 個二元原型與逐特徵可靠度;學習可靠度用的來源品質世界(主要規模 20 個世界/280 回合/28 次觀察);q ∈ {0.06 … 0.42} 帶潛在共同反轉的相關來源叢集世界;以及 regime 切換的動態世界。主要 seed 20260908(v0.1)與 20260909(v0.3 起);次要 seed 標為事後。
- 資料集DAT-2026-0002PACC-Hybrid v0.1 共享候選池1,568 個候選池實例(7 類 × 28 題 × 8 次重複,每池 112 個候選),合成生成並一模一樣地提供給 A/B/C 三個條件,附 primary、multiseed 與 elastic 診斷的結果 JSON。不含任何語言模型輸出。
基準 · 4
- 基準BEN-2026-0001PACC 微型實驗室協定 v0.1(凍結門檻)從 v0.1 到 v0.13 原封重用的預登記判決規則:E0 純度、held-out 表徵距離 D_R = E[JS(Φ(S_N), S_P)] ≤ 0.05、更新交換 D_U ≤ 0.05、離流形干預 D_I ≤ 0.08、行動一致度 ≥ 0.85、真實映射必須勝過的 shuffled-target 負控制、設計獨立規則(一致度 ≥ 0.999 且 R² ≥ 0.995 即視為同一家族)、判決等級 0–3,以及至少三個獨立收斂家族的強 PACC-A 門檻。
- 基準BEN-2026-0003PACC-LLM 混合 A/B/C benchmark三種條件跑在完全相同的候選池上:A 純生成器、B 硬驗證器、C PACC runtime(另有事後的 D「elastic」)。v0.1:7 類 × 28 題 × 8 池 × 112 候選(1,568 個共享池實例)。指標:明示硬約束遵守、衍生一致性、軟意圖滿足、長程保持、原始與有效新穎度、pattern entropy。v0.2:16 個手寫自然語言任務、相同計費預算、只有對條件盲的評審看得到 gold rubric。
- 基準BEN-2026-0002AER-0 架構比較套件(R1–R6)逐輪成長的決定性可執行比較:R1——兩個事實(一穩定、一在第 8 與 16 小時改變)、17 個模擬小時內 8 次查詢,基線 B1 無狀態/B2 固定 6 小時 TTL/B3 記憶 + 工具/B4 事件驅動複合 agent;R3——分散政策 vs 集中式應用 gate vs AER-ECT,比 provenance、stale write、audit 與依賴綁定;R4——N ∈ {1, 4, 16, 64} 個 caller × 6 條規則的政策拓撲縮放;R5——五個威脅層上的十種繞過情境;R6——連貫的整庫偽造、anchor 竄改、有/無可信 head 的前綴截斷、fail-closed anchor、孤兒 anchor、adapter 一致性。
- 基準BEN-2026-0101XA-02——A0→A5 鷹架響應的 30 題 pilot 任務包30 題——數學 10、程式 10、約束 10——含公開任務檔(題目、輸出契約、預先登記的品質投影)、絕不可進入模型上下文的私有參考檔、確定性評分器與 30/30 自測。數學與約束題回一個 JSON 物件;程式題回 Python 原始碼、以隱藏測試評分,且除非在外部沙箱明確啟用,否則拒絕執行程式。套件自己的說法:不是通用智能 benchmark,而是 Experiment A 下量測鷹架響應的受控儀器。
研究計畫
全部 (2) →- 計畫PRG-2026-0001自適應世界狀態系統的第一原理框架從第一原理推導 AI runtime 的長期研究線:世界知識以不同速率變化、自然語言是 rendering 而非 canonical state、能力必須被記憶與重用、算法與計算載體分離;然後把推導結果逼進可執行的現實——AER-0 參考 runtime 與六輪架構比較,以及檢驗非概率 primitive 是否收斂到概率表象的 PACC 微型實驗室。
- 計畫PRG-2026-0101智能的物理計量(IPM)這個研究計畫問的不是「AI 有幾分聰明」,而是一個答案讓物理系統付出了什麼:花了幾次使用者回合、幾條生成軌跡、幾層隱藏 LOOP,做了多少有效語意工作,占用多少能量與計算時空,依賴多少外部鷹架,最後換回多少可驗證品質。十篇理論論文(2026-09-02)定義了測量物件——任務、品質、語意工作、物理計算、鷹架能力、測量詮釋資料——與五個可證偽命題;v0.2 實驗協定(Experiment A:single-pass vs scaffolded)落實為 XA-02…XA-06L 儀器套件,並在本地 9B 模型上執行過一次。
模型與架構
全部 (6) →- 模型MOD-2026-0006Qwythos-9B-v2(Q4_K_M,本地,Ollama)qwen35 系的開放權重 9.0B 模型,GGUF Q4_K_M,由 Ollama 0.33.3 在 RTX 3070 上本地服務。在 PACC-Hybrid v0.2 協定的真實本地執行中同時擔任生成器、選擇器與評審,第一、二次執行關閉思考,第三次執行開啟(effort medium,每次呼叫多 3,500 個輸出 token)。
- 模型MOD-2026-0001N0——帶號支持每個假設的加性帶號證據支持;在均勻可靠度下它與重縮放的 log-evidence 累積關係密切——這正是異質與對抗壓力測試存在的原因。
- 模型MOD-2026-0002N1——序數錦標賽假設之間的成對序數競爭;在所有測過的軌跡上,行為與線性關係都與 N0 相同。
- 模型MOD-2026-0003N2——帶號圖假設之間的帶號關係圖與圖動力學;吸引域邊界家族——在對抗幾何下未達表徵門檻(v0.2)、高相關下較不穩定(v0.4)、轉移吸引域最窄且對 seed 敏感(v0.8)。
- 模型MOD-2026-0004N3——約束競爭v0.2 加入的非線性約束場系統,作為第三個結構相異的家族;跨幾何雙向收斂(v0.7),與 N0/N1 共享較寬的吸引域(v0.8)。
- 模型MOD-2026-0005Bayesian 參考(精確後驗/Beta-Bernoulli/聯合共同因/HMM)每次比較的概率端:帶數值可靠度的精確後驗、Beta-Bernoulli 來源品質學習、相關叢集的聯合概似共同因模型(及其天真獨立負控制),以及 regime 切換用的 Bayesian HMM。
最新論文
全部 (24) →- 論文PAP-2026-0009概率不等於貝葉斯——從隨機系統、概率模型到 Bayesian 更新的認識論邊界從 stochastic 到 generalized Bayesian 的分層詞彙,以及檢查「事後被說成 Bayesian」的 Bayesian authenticity test。
- 論文PAP-2026-0005記憶、算法庫與可重用問題求解路徑——從世界模型到能力模型的累積式智能架構算法、工具、契約、成本與成敗歷史成為能力節點;Reuse ≻ Adapt ≻ Create。
- 論文PAP-2026-0006載體中立的計算容器理論——從算法選擇到異質計算載體聯合調度任何具可表示輸入、有效轉換與可讀輸出的執行環境都是計算容器;算法與容器聯合調度。
- 論文PAP-2026-0007盲推導 AI——不同第一原理是否收斂到同一工程形態?把前六篇視為一次盲推導實驗,提出比較協定與五種相似性層級,用來對照現代 AI。
- 論文PAP-2026-0008智能架構吸引子——差異究竟存在於哪一層?六個架構差異層級、架構等價類與吸引域;被執行的架構才是架構。
- 論文PAP-2026-0010貝葉斯中的貝葉斯——誰授權更新規則?從 Prior、Likelihood 到 Meta-Epistemology 的遞歸問題Prior、likelihood 與假設空間需要一個 Bayes 公式給不出的授權;meta-epistemic configuration 成為架構的一部分。
研究系統
全部 (7) →- 系統SYS-2026-0002PACC-Lab——收斂猜想的微型實驗室可完全觀察的證據整合環境、四個 primitive 層非概率家族(N0–N3)、精確 Bayesian 參考、只在訓練集擬合的低複雜度映射器、shuffled/constant/broken-composition 控制組、設計冗餘診斷,以及從 v0.1 到 v0.13 原封不動的預登記門檻。每個版本都是密封的 FINAL 套件,含協定、結果與下一步實驗的預登記。
- 系統SYS-2026-0003PACC-LLM 混合實驗室A/B/C harness——純生成器、硬驗證器、PACC runtime——在共享候選池與相同計費預算上運行。v0.1 是合成的架構見證(零次 LLM 呼叫);v0.2 加入手寫自然語言任務、對條件盲的評審、獨立於評審的字面機器檢查、缺 API key 時 fail-closed,以及 live run 後可精確重播的凍結快取。
- 系統SYS-2026-0001AER-0——自適應認識 runtime MVP以 Python + SQLite 實作、自己持有持久 canonical state 的參考 runtime;語言模型可有可無、可替換。Candidate → verify → 版本化 commit、fact/relation 強制 provenance、新鮮度與信心分開存放、非對稱張力排程與 shock 觸發刷新、capability/container 註冊表、持久化 workflow 記憶(reuse/adapt/create)、以及 deterministic/rule/Bayesian/heuristic 的認識論 router。經六輪比較長成帶 SQLite 層中介、Ed25519 簽章外部 anchor 與程序分離 writer 的 epistemic commit transaction(R6 時 79 個測試)。在 mssp-tdd-apr 下以 DEGRADED-TWIN 開發——不主張獨立 twin 驗證。
- 系統SYS-2026-0101XA-03——遙測與執行記錄器(物理執行證據層)與模型供應商無關的記錄器:把一次 benchmark 執行記成只增不改的事件流與遙測,再確定性地導出型別化摘要——模型呼叫、軌跡、工具呼叫與驗證器區段,候選建立/丟棄會計,wall time、裝置時間、GPU 功率積分成 device_energy_j(能量型別 device_measured,絕不改標成 marginal)、峰值記憶體與記憶體駐留,未知值保持 null(Unknown ≠ 0),並禁止 tokens → J、TDP → J、price → J、GPU-hours → J 的換算。黃金夾具 450 J/1.75 util·s/12 GB 峰值/33 GB·s 駐留驗證通過;35 passed, 1 skipped in 0.39s;儀器負擔經校準並報告,不自動扣除。
- 系統SYS-2026-0102XA-04——A0→A5 模型執行器與鷹架調度器策略驅動的狀態機,用不可變的條件策略跑同一個 TrialExecutor:A0 原生單次、A1 放大單軌跡(2× 生成預算)、A2 八樣本精確多數決、A3 八樣本加型別化驗證器、A4 驗證器加有界的確定性工具迴圈、A5 有界的 PLAN → ACT → OBSERVE → VERIFY → REVISE 迴圈。XA-02 與 XA-03 是外部 canonical 依賴(以雜湊宣告、不內嵌);A0–A3 下的工具動作是協定違規;benchmark 評分只在 XA-03 執行封存後進行,評分成本永不計入受測系統;私有參考檔不被任務載入器讀取;不擷取私有思考鏈。29 個測試,狀態 CANDIDATE_CLEAN_VERIFIED。
- 系統SYS-2026-0103XA-06——真實模型 pilot 閘把真實模型放進已驗證的 XA-01→XA-04 儀器:preflight(一次隔離的 MATH-003/A0 試驗走過供應商、XA-03 與 XA-02)、canonical 36 試驗矩陣(MATH-003、CODE-001、CON-003 × A0…A5 × 2 次)、閘驗證與分析。凍結 temperature/top-p/seed,A0/A1 的生成預算倍率轉入 token 預算,計算機工具契約只注入 A4/A5 的生成請求,停用的程式評估視為「品質不可得」而非零分,且工程驗證永遠不能升格為 pilot 完成:「沒跑真模型,就沒有真模型宣稱」。合法的真實結果明文包含 A0 = A5、A3 < A2、A5 < A0 與 SSR = 1。20 個測試;套件本身不含 pilot 結果(狀態 READY_FOR_REAL_MODEL)。
研究圖譜
全部 (499) →封存
全部 (0) →尚無公開紀錄。
狀態與證據詞彙
- 研究狀態
- IDEA
- 目前只有問題或概念
- PRELIMINARY
- 已有初步的形式化或觀察
- ACTIVE
- 正在持續研究
- EXPERIMENTAL
- 正在進行實驗驗證
- VALIDATING
- 主要命題已形成,正在做證據確認
- REPLICATING
- 正在做重現或跨模型驗證
- STABLE
- 目前的研究結論相對穩定
- PAUSED
- 暫停
- ARCHIVED
- 停止主動推進
- SUPERSEDED
- 已被新版本或新理論取代
- 證據等級
- E0
- 僅有概念
- E1
- 內部觀察
- E2
- 受控實驗
- E3
- 重複實驗
- E4
- 跨模型/跨環境重現
- E5
- 外部重現/獨立證據
- 資料基礎
- THEORY
- 純理論推理,沒有量測。
- SYNTHETIC
- 合成數據與理論推理。現在很多人把合成數據當成真的;這個實驗室刻意反過來說——在真正的混合模型出現之前,推論就只是推論,理論上可能不等於實際上可能。
- DETERMINISTIC RUNTIME
- 在真實 runtime 裡執行的決定性情境;程式碼與做法都列出,數字是什麼就是什麼。
- REAL MODEL
- 真的跑了語言模型;模型、版本與設定都記在頁面上。
- NOT RUN
- 只設計並驗證了 harness,從未用真實模型執行。
研究狀態說的是一條線走到哪裡;證據等級說的是已經證明了多少。兩者刻意分開記錄:ACTIVE 或 STABLE 不是真值宣稱,而一條 ARCHIVED 的線仍然可以帶著 E4 的證據。
資料基礎說的是一個數字是在什麼上面量出來的。合成結果在每張卡片與每一頁都標 SYNTHETIC:那是關於架構在合成條件下的證據,不是關於世界的證據。