AI 研究實驗室32 筆
實驗
每個實驗都是一等紀錄:設定、程序、執行、觀察到的結果,以及與結果分開記錄的詮釋。
- 實驗EXP-2026-0023PACC-Hybrid v0.2——第一次真實模型執行,本地 9B 開放權重模型v0.2 協定第一次在真實語言模型上執行——本地開放權重 9B(Qwythos-9B-v2、Q4_K_M、Ollama、關閉思考)同時當生成器、選擇器與評審;16 題 × 2 次 × 4 候選,380 次呼叫,每條件 32 筆。PACC runtime(C)在 supersession 對齊(相對 B +0.031、相對 A +0.097)與修復成功率(+0.070/+0.094)上升——正是 canonical intent 編譯步驟存在的那兩個軸;衍生一致性(+0.011)與意圖持續(−0.002)沒有動;有效新穎度略低(相對 B −0.045)。多數逐題配對是平手,因為 9B 評審在接近 1.0 處飽和;每題只重複兩次,評審的自由文字 pattern 標籤從不重複,所以創造廣度量不出來。三個條件在 69 % 的題 × 次配對中選了不同的候選。
- 實驗EXP-2026-0024PACC-Hybrid v0.2——真實模型第二次執行:四次重複與標籤無關的創造廣度與第一次執行相同的模型與設定,重複次數從 2 提高到 4:16 題 × 4 × 4 候選,754 次唯一模型請求,每條件 64 筆。PACC runtime(C)在任何評審軸上都沒有可靠優勢——supersession 相對 B +0.0005、修復 -0.0125,第一次執行的增益沒有重現——在遵守、一致性與意圖持續上還比 A、B 低幾個百分點。新的標籤無關廣度指標(本地 nomic-embed-text 嵌入、對每題候選池做 k-means 當標籤)沒有發現塌縮:C 的群熵 0.923,A 0.909/B 0.864;廣度比 0.975,對 0.948/0.941。五次 selector/judge 輸出未通過嚴格 JSON 解析,依公開的重試政策重新生成。
- 實驗EXP-2026-0025PACC-Hybrid v0.2——真實模型第三次執行:開啟思考並放大輸出預算同一顆本地 9B 模型,開啟思考(reasoning.effort = medium),每次呼叫多給 3,500 個輸出 token 讓隱藏推理有空間;12k context;16 題 × 2 次 × 4 候選,380 次唯一請求,每條件 32 筆,3.7 小時。PACC runtime(C)的平均有效新穎度最高(0.8375;相對 B +0.0687、相對 A +0.0375),平均修復成功率也最高(+0.0153/+0.0466)——但逐題 × 次配對的戰績是平的(有效新穎度勝–平–負:對 B 6-21-5、對 A 5-20-7;修復對 B 1-29-2),平均差來自 multi_constraint 與 repair 題裡少數幾個大差距——遵守、一致性、意圖持續與 supersession 則持平到低幾個千分點(相對 B -0.0069、-0.0063、-0.0053、-0.0059)。開啟思考後三個條件全部通過所有確定性字面檢查。標籤無關廣度在 C 下再次沒有縮減:群熵 0.875,A 0.750/B 0.688;廣度比 1.047,對 0.960/0.973。兩次 selector 輸出依公開的重試政策重新生成(一次被截斷、一次推理吃光 3,800 token 預算後輸出為空)。
- 實驗EXP-2026-0009PACC-Lab v0.2——第三個家族(N3)與對抗性證據幾何加入非線性約束場家族 N3 約束競爭,以及專門用來破壞加性/log-odds 映射的對抗性幾何,所有 v0.1 門檻不變。N3 在三種幾何下都達 Level 3;N2 在對抗幾何下一致度 0.8546、更新/干預誤差仍小,但 held-out 表徵 JS 0.053327 越過 0.05 門檻,歸為僅行為收斂。線性診斷下的獨立家族:{N0, N1}、{N2}、{N3};三種幾何下都穩健的:兩個。
- 實驗EXP-2026-0010PACC-Lab v0.3——無 oracle 的來源可靠度學習雙方都失去來源品質 oracle:Bayesian 參考學 Beta-Bernoulli 來源品質;非概率系統學定性聲譽(信任、摩擦、連勝、熟悉度)。在訓練世界上擬合、在未見過的來源品質排列上評估,聲譽狀態映射到 Beta-Bernoulli 狀態的 JS ≈ 0.00714,shuffled/constant 控制組為 0.017–0.018,回饋更新交換 ≈ 0.00130——跨 seed 穩定 6/6。任務狀態收斂則依架構與 seed 而異:在主要規模下 N0/N1 4/4、N2 3/4、N3 2/4。
- 實驗EXP-2026-0011PACC-Lab v0.4——相關來源與依賴幾何來源分成叢集並帶潛在共同反轉;正確的參考用聯合概似,天真的獨立乘積 Bayes 是負控制(在中、高相關幾何下聯合勝過天真;獨立幾何下差距恰為 0)。非概率系統只看得到叢集歸屬。任務狀態收斂存活:N0/N1/N3 在中、高相關下通過(N2 在高相關下一致度掉到 0.8364)。潛在依賴座標——叢集處於受污染分支的後驗——任何系統的 train-only affine-sigmoid 映射都無法重建:真實 JS ≈ shuffled ≈ constant。
- 實驗EXP-2026-0012PACC-Lab v0.5——更豐富的關係狀態能救回潛在座標嗎?豐富的關係圖比 v0.4 的精簡 bundle 保留多得多的來源/成對/模式資訊,且任務行動完全相同。它救不回凍結的 direct affine-sigmoid 到共同因座標的映射:精簡 0、豐富 0 次穩健通過,真實/控制比 ≈ 0.96–1.02,四個次要 seed 也沒有任何系統被救回。反事實來源翻轉探針常單獨通過,顯示局部方向對齊部分存在,但沒有全域可判別的座標。
- 實驗EXP-2026-0013PACC-Lab v0.6——階層式組合座標一個預登記的 95 維組合座標——已驗證任務狀態映射的 held-out 決策商,結合當前關係模式與有界的交互項——在兩種幾何下對四個家族都預測出 Bayesian 共同因座標:組合潛在 JS 0.0034–0.0073,shuffled/constant 為 0.040–0.062,刻意弄壞的組合為 0.040–0.060;反事實 JS 0.0018–0.0047;四個次要 seed 下 direct 通過率 0.0、composed 1.0。
- 實驗EXP-2026-0014PACC-Lab v0.7——不重新擬合的跨幾何座標轉移把 v0.6 的組合座標凍結在一種依賴幾何上、套用到另一種。N0/N1/N3 在主要協定與 4/4 次要 seed 下雙向轉移;N2 高 → 中通過,但中 → 高在主要 seed 下以 ≈ 0.0003 之差未達任務商門檻(次要 2/4),而針對性的較大規模壓力測試 3/3 通過。所有目標本地重擬合都通過,因此 N2 的失敗不是目標 chart 的失敗。
- 實驗EXP-2026-0015PACC-Lab v0.8——相關度掃描下的凍結座標轉移吸引域在 q* = 0.20 擬合的一個組合座標,原封不動地套用到九點掃描 q ∈ {0.06 … 0.42}(叢集內正確性相關從 ≈ 0.203 升到 ≈ 0.502)。N0/N1/N3 通過到 q = 0.33、從 0.36 起失敗;N2 通過到 0.30、從 0.33 起失敗。在邊緣先失去的是負控制判別餘裕,而絕對潛在誤差仍小;目標本地重擬合處處 9/9 通過。四個次要 seed 對 N0/N1/N3 精確重現吸引域,N2 在 0.33 的邊緣對 seed 敏感。
- 實驗EXP-2026-0016PACC-Lab v0.9——三錨點概率座標圖冊在 q = 0.12、0.24、0.36 的三個預登記 chart 給每個家族相同的聯集 {0.06 … 0.36}:掃描覆蓋 8/9,三個次要 seed 下穩定,永遠蓋不到 q = 0.42。最近的 chart(0.12/0.24)直接一致;相距遠的(0.12/0.36)不一致(任務 JS ≈ 0.071–0.082),但在獨立 seed 上校準的低複雜度轉換映射在主要協定下每個家族 6 個方向通過 5 個——弱方向是 0.36 → 0.12(潛在 JS ≈ 0.017–0.021 > 0.01)。轉換一致性在次要 seed 下不穩健(平均通過 ≈ 0.53–0.67)。
- 實驗EXP-2026-0017PACC-Lab v0.10——凍結三重重疊上的定向 cocycle 一致性在 v0.9 圖冊中 A、B、C 三個 chart 都有效的凍結區域上,直接轉換 A → C 與組合 A → B → C 在潛在 JS 上一致到 ≈ 10⁻⁵(shuffled-pair 控制 ≈ 10⁻¹),且兩條路徑各自對 chart C 都準確(潛在 JS ≈ 0.0045–0.0054)。四個家族在主要 seed 與四個次要 seed 下都通過。N2 只有一個三重重疊幾何(q = 0.24),見證較窄。
- 實驗EXP-2026-0018PACC-Lab v0.11——雙向 cocycle 與反向一致性區分三個性質:正向 cocycle 組合(所有家族都存活)、往返反向一致性(主要 run 所有成對往返都通過,在較大規模 3/3 恢復,但小規模下對樣本敏感,最寬的 AC 對最弱),以及反向傳輸對目的 chart 的保真度(所有家族都失敗:直接 C → A 潛在保真度 0.0116–0.0148 > 0.01,而直接與組合反向路徑彼此一致到 ≈ 10⁻⁵)。
- 實驗EXP-2026-0019PACC-Lab v0.12——有界二次轉換轉換容量以一個預登記的步驟從 20 個仿射係數升到 60 個固定二次係數,chart、支撐、切分、控制與門檻不變。沒有家族被救回:反向保真度 0.0111(N0/N1)、0.0139(N2)、0.0141(N3),門檻 0.01,次要 0/4、較大規模 0/3;正向 cocycle 與反向一致性在二次類下存活。實驗室在此停止,而不是看到結果後升級到三次、四次或神經轉換。
- 實驗EXP-2026-0020PACC-Lab v0.13——反向殘差場/基點依賴量測 held-out 反向殘差 r_CA(S) = Φ_A(S) − T_CA(Φ_C(S)) 的均值、共變異、潛在 logit 能量集中度、層間 vs 層內變異、方向穩定性,以及只用訓練集的逐層常數校正(對照全域與 shuffled 層控制)。N0/N1 把 98 % 的殘差能量集中在潛在 logit 軸上,但均值方向跨 seed 翻號(跨 seed 餘弦 ≈ −1),層間結構只有 ≈ 0.1–0.3 %(門檻 20 %),逐層校正對 held-out 保真度的改變 < 10⁻⁵——沒有家族通過。
- 實驗EXP-2026-0021PACC-Hybrid v0.1——合成 A/B/C 架構見證在 1,568 個完全相同的候選池上,純生成器(A)、硬驗證器(B)、PACC runtime(C)以硬約束遵守、衍生一致性、軟意圖滿足、長程保持、新穎度與 pattern entropy 計分。B 已經把字面硬約束遵守飽和到 1.0;C 相對 B 衍生一致性 +0.2085、長程保持 +0.0142、有效新穎度 +0.1964、軟意圖滿足 −0.0076,並在純創意控制組中提高逐點新穎度(0.9864 vs 0.8889)卻讓 pattern entropy 塌縮(0.2284 vs 0.7199)。事後的「elastic」探索策略(D)在衍生一致性仍為 1.0 下把 entropy 恢復到 0.7638。零次真實 LLM 呼叫;八個 seed 符號穩定。
- 實驗EXP-2026-0022PACC-Hybrid v0.2——真實語言模型 A/B/C harness(尚未執行)16 個橫跨預登記家族的手寫自然語言任務;A/B/C 共用一本候選帳本與相同計費預算;C 拿不到 gold 約束或 supersession metadata;gold rubric 只有對條件盲的評審看得到;字面機器檢查獨立於評審;相同答案重用同一個評審快取鍵;沒有 OPENAI_API_KEY 時 fail-closed;凍結快取重播提供者讓 live run 後可精確重播。25 個測試通過。執行環境沒有 API key,因此不存在任何真實模型輸出;隨附的 mock smoke 檔標為 MOCK_ONLY_NOT_REAL_MODEL。
- 實驗EXP-2026-0001AER-0 MVP v0.1 收束:不變量能不能被執行?核准的 Python + SQLite runtime 在 mssp-tdd-apr 下建成,並以行為、結構、判別三類見證收束:candidate gate、provenance 驗證、過期版本衝突、穩定 vs 易變排程、shock 觸發、verifier 拒絕、workflow reuse/adapt/create、模型替換、無模型核心、端到端已驗證 commit。25 個測試;refresh benchmark 在固定 TTL 下選了 2 個節點、在張力排程下只選 1 個易變節點;密封封存包乾淨解壓重播通過後才發布。
- 實驗EXP-2026-0002R1——對四個基線的決定性語義比較兩個事實(一穩定、一在第 8 與 16 小時改變),17 個模擬小時內 8 次查詢。B1 無狀態每次重算;B2 固定 6 小時 TTL;B3 加 workflow 記憶;B4 是帶事件驅動失效的複合 agent。AER-0 在零過期回答、零穩定節點刷新與 workflow 重用上與 B4 打平,因為張力政策主動刷新而多一次重算(3 vs 2),但只有它擋下無 provenance 的事實並抓到衝突寫入。
- 實驗EXP-2026-0003R2——對 LangGraph 1.2.11 的 source-grounded 結構比較LangGraph 1.2.11(checkpoint 4.2.0、checkpoint-sqlite 3.1.1)裝不起來——對外 PyPI DNS 不可用——因此本輪釘住公開的 release/source 合約,與 AER-0 可執行的不變量比較。runtime 持有的持久狀態、checkpoint 歷史、版本追蹤、長期 store 與 TTL 記憶全部收斂(LangGraph 在 resume、time travel、並行控制與 delta checkpoint 上更豐富)。仍屬 AER 預設獨有的是:candidate → verify → commit、強制 fact provenance、節點層樂觀認識論 commit、任務條件化的張力刷新、capability/container 分離、明示的認識論算子路由,以及「圖」指的是認識論世界表徵而非控制流。
- 實驗EXP-2026-0004R3——認識論 commit 交易 vs 分散式與集中式應用 gateAER-0 所有 canonical 寫入遷移到 Epistemic Commit Transaction(claim、evidence、provenance、有效/觀察時間、expected version、算子、驗證政策、權限、依賴、refresh policy);直接 candidate commit 變成負向路徑。三套系統跑同一組治理見證:政策分散在各 caller 的應用、有單一集中強制 gate 的應用、AER-ECT。集中式應用 gate 在每個測試性質上都追平 AER-ECT;不支持計算獨特性。48 個測試。
- 實驗EXP-2026-0005R4——政策變異面:分散治理 vs 單一強制邊界對 N ∈ {1, 4, 16, 64} 個 canonical 寫入 caller 與 R = 6 條治理規則,政策站點與規則放置在分散治理下隨 N 與 N·R 成長,在集中式應用 gate 或 AER-ECT 下固定為 1 與 R;新規則要改 N 個 caller vs 改一處;75 % 的 caller 端遷移仍留下 64 個中的 16 個在舊合約上。反向權衡明說:漏掉一條局部規則的爆炸半徑是 1/N,共享 gate 的缺陷爆炸半徑是 1,而在等 p 的玩具遺漏模型下三套系統的預期受影響 caller 比例相同。
- 實驗EXP-2026-0006R5——完全中介與繞過抗性橫跨五個威脅層的對抗性邊界測試,前提是加入受管連線的 SQLite authorizer、五張受保護表的 trigger guard、只有 verifier 能寫的驗證狀態、BEGIN IMMEDIATE 的 commit 序列化,以及 reference-monitor/canonical-integrity 稽核。十種情境:五種 PREVENTED(受管直接寫、schema 完整的外部原始寫、驗證後竄改、偽造 verdict、受管移除 guard)、三種 OPEN_DETECTED(外部移除 guard、移除 guard 後偽造節點、同程序敵意停用)、一種 OPEN_UNDETECTED(整庫寫入者一致地偽造節點與其 backing candidate)、一種同基底雙程序競賽 SERIALIZED_TO_SEMANTIC_CONFLICT。
- 實驗EXP-2026-0007R6——外部信任 anchor、程序分離 writer、adapter 一致性每次外部錨定的 commit 都把已接受轉換的 digest 綁進 Ed25519 簽章的 hash chain,並可選帶外的最新 head 收據;簽章權限移入永不回傳私鑰的子 writer 程序;行為一致性 harness 定義未來任何 state adapter 必須通過的合約。R5 的連貫整庫偽造在內部稽核下仍是 OPEN_UNDETECTED,在外部 anchor 稽核下變成 OPEN_DETECTED;anchor 竄改 DETECTED;有效前綴截斷在無可信 head 時未偵測、有 head 時偵測;必要 anchor 失敗時在測試路徑上 fail-closed;孤兒 anchor 被偵測;SQLite adapter 通過合約,刻意弄壞的 adapter 被拒。79 個測試。
- 實驗EXP-2026-0008PACC-Lab v0.1——E0–E4:第一個微型見證三個 primitive 層的非概率系統(N0 帶號支持、N1 序數錦標賽、N2 帶號圖)在四個隱藏假設上整合證據,旁邊是精確的 Bayesian 參考。三者在均勻與異質證據品質下都通過 Level-3 微型準則——held-out JS ≤ 0.0101、更新 JS ≤ 0.0042、干預 JS ≤ 0.0058、行動一致度 ≥ 0.957——shuffled-target 控制組約 0.31–0.33。冗餘診斷把 N0 與 N1 合併為一個精確重參數化家族,獨立家族只剩兩個,未達 PACC-A 最低要求三個。
- 實驗EXP-2026-0103XA-06 第一次真實模型 pilot——Qwythos-9B-v2 走 A0→A5 階梯(36 試驗,2026-09-03)第一次把真實模型放進 IPM 儀器:hf.co/empero-ai/Qwythos-9B-v2-GGUF:Q4_K_M 由 Ollama 在 RTX 3070 上服務,2026-09-03 由 Splice(Claude Code)在 Neo.K 授權下透過 XA-06L 於本地執行——MATH-003、CODE-001、CON-003 × A0–A5 × 2 次,36 次試驗、186 次呼叫、162 條軌跡,每次試驗遙測完整。封存為 REAL_MODEL_PILOT_INCOMPLETE:33/36 完成,三次試驗因同模型驗證器對嚴格解析器回了非 JSON 而中止(真實的模型行為,刻意不重擲)。SSR = 1.0、SDR = 0.0:在這三個簡單任務上鷹架沒有帶來可測的品質增益,A5 卻用了 A0 的 3.10× 裝置能量與 3.13× wall time,固定八樣本的 A2–A4 用了 7.9–9.3×。A3/A4 看似升到 0.667 是缺值造成的假象;且三個任務裡有兩個,記錄到的「品質」是輸出格式服從性而非任務正確性(事後檢查:33/33 完成的輸出語意正確;嚴格輸出契約合規 12/36)。
- 實驗EXP-2026-0102XA-05——以腳本化供應商跑的 36 試驗端到端煙霧閘(合成)用 ScriptedProvider 把 MATH-003、CODE-001、CON-003 × A0–A5 × 2 次跑過 XA-04 + XA-03 + XA-02,輸出被刻意設計成品質曲線事先已知(A0 0.30、A1 0.633、A2–A5 1.0 → SSR 0.30/SDR 0.70 純屬夾具)。36 次試驗、180 次呼叫、168 條軌跡、6 次重試、6 次工具呼叫、24 次驗證;候選 168 = 36 選中 + 132 丟棄;會計不符 0 件、私有參考洩漏 0 件;能量刻意為 null(NullCollector)以證明 Unknown ≠ 0。套件明寫 scientific_interpretation_allowed: false。
- 實驗EXP-2026-0101Experiment A——單次智能與鷹架增益的受控實驗協定 v0.1第一個 v0.2 實驗:對同一模型與固定任務集,沿鷹架階梯 A0 原生單次 → A1 放大軌跡 → A2 多樣本 → A3 驗證器 → A4 確定性本地工具 → A5 有界完整 agentic 迴圈往上爬,每一級同時記品質與物理成本,得出鷹架響應曲線、SSR/SDR、鷹架成本倍率與邊際產率。五個假說(H1 增益存在、H2 增益有物理成本、H3 邊際產率非常數、H4 原生與系統能力可區分、H5 不同模型有不同鷹架剖面)、預先登記的品質投影、A0–A3 初始資訊相等、預算上限、pilot n = 5/正式 n = 20 次重複、失敗分類,以及「null 結果不是實驗失敗」的規則。狀態 READY FOR PILOT;三十題的正式執行尚未進行——只跑過下面的三題儀器閘。
- 實驗EXP-2026-0104Experiment B——二元 vs 數值的人類測量(已宣告)比較直接 0–10 評分、結構化是/否題與自適應成對比較在反應時間、缺答、不一致、重測、預測效度與疲勞上的表現,受試者隨機分配到不同格式。canonical index 宣告為 v0.2 第三個實驗;尚未細部設計、尚未執行。
- 實驗EXP-2026-0105Experiment C——μI 的操作性辨識(已宣告)在證明步驟、程式修復與約束謎題上建構候選語意轉換,再以消融與反事實替換檢驗,看有效語意計數 N_μ 能否被辨識、能否預測任何事。宣告為 v0.2 第四個實驗;尚未執行。
- 實驗EXP-2026-0106Experiment D——物理軌跡對齊(已宣告)在同一台機器上把 GPU 功率遙測、延遲、峰值記憶體、記憶體頻寬與裝置占用對齊到執行事件——XA-03 已提供的遙測面——在任何資料中心能源宣稱之前先做。建議順序中的第二個 v0.2 實驗;pilot 的 XA-03 軌跡是它的第一批原料,但對齊研究本身尚未執行。
- 實驗EXP-2026-0107Experiment E——token/FLOPs 代理量失效檢驗(已宣告)在相同任務品質下用不同語言、冗長度、上下文長度與記憶體壓力執行,比較 token 數、FLOPs、能量、時間、記憶體流量與 N_μ^eff,看 token 與 FLOPs 在哪裡不再追蹤成本與工作。宣告為 v0.2 最後一個實驗;尚未執行。