AI 研究實驗室18 筆
結果
觀察到的結果,與詮釋分開存放。負面、混合與無定論的結果一樣列出。
- 結果RST-2026-0014真實本地模型 A/B/C 表(Qwythos-9B-v2)v0.2 協定第一次在真實語言模型上執行——本地開放權重 9B(Qwythos-9B-v2、Q4_K_M、Ollama、關閉思考)同時當生成器、選擇器與評審;16 題 × 2 次 × 4 候選,380 次呼叫,每條件 32 筆。PACC runtime(C)在 supersession 對齊(相對 B +0.031、相對 A +0.097)與修復成功率(+0.070/+0.094)上升——正是 canonical intent 編譯步驟存在的那兩個軸;衍生一致性(+0.011)與意圖持續(−0.002)沒有動;有效新穎度略低(相對 B −0.045)。多數逐題配對是平手,因為 9B 評審在接近 1.0 處飽和;每題只重複兩次,評審的自由文字 pattern 標籤從不重複,所以創造廣度量不出來。三個條件在 69 % 的題 × 次配對中選了不同的候選。
- 結果RST-2026-0015第二次執行:條件間無可靠差異;廣度未縮減(64 筆)C 相對 B:supersession +0.0005、修復 -0.0125、衍生一致性 -0.0075、意圖 -0.0114、有效新穎度 -0.0187;標籤無關廣度:群熵 C 0.923/A 0.909/B 0.864。
- 結果RST-2026-0016第三次執行:開啟思考後 PACC runtime 的有效新穎度與修復上升;治理持平;廣度未縮減(32 筆)C 相對 B:有效新穎度 +0.0687、修復 +0.0153、語義新穎度 +0.0166、衍生一致性 -0.0063、意圖 -0.0053、supersession -0.0059;C 相對 A:有效新穎度 +0.0375、修復 +0.0466;標籤無關廣度比 C 1.047/A 0.960/B 0.973。
- 結果RST-2026-0007v0.2 對抗幾何:N3 收斂、N2 越過表徵門檻N3 held-out JS 0.014454(Level 3);N2 held-out JS 0.053327 > 0.05(Level 1);N0/N1 0.023921(Level 3)。
- 結果RST-2026-0008v0.4:潛在依賴座標無法重建四個系統在每個 seed 下依賴座標通過數皆為 0;高相關下真實 JS ≈ 0.0398 低於 0.05 絕對門檻,但不比 shuffled(≈ 0.0400)或 constant(≈ 0.0397)好。
- 結果RST-2026-0009v0.6:組合座標 4/4、直接映射 0/4每個家族與幾何下組合潛在 JS 都 ≪ shuffled/constant 且 ≪ 弄壞的組合(例如中相關 N0:0.003603 vs 0.061508 vs 0.058196)。
- 結果RST-2026-0010v0.8 吸引域圖在 q* = 0.20 擬合的凍結 chart:N0/N1/N3 在 {0.06 … 0.33} 通過、N2 在 {0.06 … 0.30};邊緣最先失敗的門檻是負控制判別(N0/N1 在 q = 0.36 比值 ≈ 0.858);本地重擬合 9/9。
- 結果RST-2026-0011v0.10 cocycle:路徑分歧 ≈ 10⁻⁵ vs 控制 ≈ 10⁻¹直接 vs 組合的潛在 JS:3.5×10⁻⁵(N0/N1)、4.0×10⁻⁵(N2)、2.7×10⁻⁵(N3);真實/shuffled 比 ≈ 3×10⁻⁴;兩條路徑對 chart C 都準確。
- 結果RST-2026-0012v0.11 反向目的偏差反向路徑彼此一致(潛在 JS ≈ 10⁻⁵),但兩者都落在離真正 chart-A 座標 ≈ 0.011–0.015 處,高於 0.01 門檻,所有家族、所有測試規模皆然。
- 結果RST-2026-0013Hybrid v0.1 A/B/C 差值C − B:衍生一致性 +0.2085、長程保持 +0.0142、有效新穎度 +0.1964、軟意圖 −0.0076;C − A pattern entropy −0.4915(純創意),事後 elastic 選擇恢復到 0.7638。
- 結果RST-2026-0001R1 比較表AER-0:0 過期、3 次重算、0 次穩定節點刷新、6 次 workflow 重用、擋下無 provenance 事實、抓到衝突寫入。B4:0 過期、2 次重算、0 次穩定刷新、6 次重用、兩者都不擋。
- 結果RST-2026-0002R2 分類矩陣七個軸收斂或部分收斂(其中四個 LangGraph 更豐富);六個軸為 AER 預設獨有;圖語義為語義上不同。
- 結果RST-2026-0003R3:AER-ECT ≈ 集中式應用 gate在擋無 provenance 寫入、過期寫入衝突、自動 audit、依賴綁定與單一治理站點上,集中式應用 gate 與 AER-ECT 都 PASS;分散式應用在遺漏見證上失敗。
- 結果RST-2026-0004R5 十情境統計5 PREVENTED/3 OPEN_DETECTED/1 OPEN_UNDETECTED/1 SERIALIZED_TO_SEMANTIC_CONFLICT;未偵測的那一例是連貫的整庫偽造。
- 結果RST-2026-0005R6:外部 anchor 下偽造偵測翻轉同一個連貫整庫偽造:內部稽核 OPEN_UNDETECTED、外部 anchor 稽核 OPEN_DETECTED;前綴截斷:無可信 head 未偵測、有則偵測。
- 結果RST-2026-0006v0.1 主要表:N0/N1/N2 皆 Level 3,兩個家族均勻:held-out JS 0.000192(N0/N1)與 0.008053(N2);異質:0.002878 與 0.010109;shuffled 控制組 ≈ 0.31–0.33;N0↔N1 一致度 1.000、R² 1.000。
- 結果RST-2026-0101三個簡單任務上的鷹架響應:SSR = 1.0,A5 的裝置能量 3.1×、A2–A4 7.9–9.3×各條件平均(可用試驗的品質/wall 秒/裝置焦耳):A0 0.5/10.21/1715.6;A1 0.5/9.87/1819.0;A2 0.5/79.09/15143.0;A3 0.6667/99.13/15921.5;A4 0.6667/69.08/13546.2;A5 0.5/31.91/5321.5。能量相對 A0:A1 1.06、A2 8.827、A3 9.281、A4 7.896、A5 3.102。36 次試驗共量得 GPU 能量 0.0891 kWh、試驗時間 29.9 分鐘;記憶體駐留從 A0 的 72.1 GiB·s 升到 A3 的 714.6 GiB·s。
- 結果RST-2026-0102診斷:三題中兩題量到的「品質」是格式服從性;驗證器序列化失敗 3/18;A3/A4 的上升是缺值假象嚴格輸出契約合規 12/36(MATH-003 12/12、CODE-001 0/12、CON-003 0/12),但非 canonical 的事後檢查發現所有完成的選中輸出都正確——數學 12/12 canonical correct、程式 11/11 selected outputs pass all hidden tests after outer Markdown fence removal、約束 10/10 selected outputs satisfy all constraints after format-only normalization——整體 33/33。啟用驗證器的試驗 18 次,驗證器協定失敗 3 次(A3 2/6、A4 1/6、A5 0/6),每次都在已生成八個候選之後。工具呼叫 0 次、重試 0 次;24 個在中止時被拋棄的候選在 schema 裡既非選中也非丟棄。品質可得率在聚合檔報 22/36、在 protocol_compliance.csv 報 33/36。遙測取樣占 wall time 的 0.244。