把能力很強、速度很快、但不完全可靠的 AI,變成可驗證、可回復、可交付的工程系統。
桃園・台北
我不是從「怎麼讓 AI 寫更多程式」開始,而是從一次大型工程中的目標漂移開始。
AI 很會寫 code、跑測試、產報告,但它可以把:
找出正確版本
偷偷變成:
修好現在版本
然後工作量暴增,表面看起來仍然非常努力。
我親眼見過 AI 在兩週內把我的任務從「找出正確版本」偷偷改成「修好目前版本」——程式照寫、測試照過、報告完整,看起來一切正常,直到我發現它一直在解決它自己的目標,不是我的。我砍掉沉沒成本、換模型、一天內恢復了專案。
從那之後,我的工作只有一個標準:每項功能必須建置、執行、通過分層驗證,才算完成。 程式生成或編譯成功,從來不是完成。我的系統必須有能力說出「還沒完成」——證據不夠,就保持 blocked,而不是硬說成功。
| 問題 | 專案 | 一句話定位 | 連結 |
|---|---|---|---|
| 它看到的資訊是真的嗎? | Local Code Intelligence | 以結構化索引取代文本洪水,AI 第一秒看懂程式庫、節省上下文 | 連結 |
| 資料說缺 196 條,真的缺嗎? | Media Gap Analysis | 以影片標題卡 OCR 實錘取代檔名字面匹配,100% 定位缺集 | 連結 |
| 它做的功能真的能跑嗎? | b9128 Reconstruction | 把論文數學落地 CUDA,以最小探針確保資料管線流通無損 | 連結 |
| artifact 從哪裡來? | Video20 AI Workbench | 保留 prompt、model branch、fingerprint、source identity | 連結 |
| 宣稱做過的事真的發生過嗎? | TRI-100R / AI Collaboration Forensics | PLANNED_NOT_EXECUTED 不能偷偷升格成完成,以證據推進 |
TRI / Forensics |
| 現在該遵守什麼目標與邊界? | Personal Context OS | Purpose、Criteria、Boundary、Current State 由人保管 | 連結 |
| 數十個 skills 怎麼被記憶與調用? | Codex Personal Skills | 路由是 skills 與 AI 之間的潤滑劑,一鍵啟動正確能力 | 連結 |
| 原則能不能變成產品? | FunClip Local Editor | source identity 等原則收斂成 end-user 剪輯工作台(規劃中) | 連結 |
| 這些想法與證據的主樞紐在哪裡? | AI Engineering Journal | 7 篇文章從發現問題到系統化解法的路線,附完整專案關係圖 | 連結 |
於是我開始把 AI 工程拆成幾個必須被獨立驗證的問題:
解決的需求:Local Code Intelligence:瘋狂 grep 的問題不是慢,而是模型被海量文本淹沒、遺失過程、回答品質下降。LCI 用結構化索引取代文本洪水——compiler 證據、結構分析、文字 fallback 各歸各的位,讓 AI 看到精確的符號與因果,而不是幾千行相關文本;atomic rebuild 失敗也不會炸掉上一版有效 index。
實作與成果:
- 即時樹狀索引:實時更新整個代碼庫的結構樹,AI 進入陌生環境第一秒就理解現況,立刻節省上下文
- 跨模組功能性檢索:不是相似度檢索——沿樹狀圖跨模組做功能性檢索;專案越大越強,尤其適合跨專案超大型資料庫、模組化與分佈式架構的專案庫
- 對象是 AI agent:以最少 token 取得精確的符號、呼叫與因果,取代 grep 文本洪水
- 可查證的答案合約:每個查詢回傳 execution status、result found、source、semantic level、confidence 與 provenance 分開陳列——程式沒 crash 不等於查到答案,text match 不等於結構關係
- 實測規模:6 種語言(C/C++/CUDA/Python/JS/TS)、9 個 MCP tools、36 個 golden benchmark scenarios(bounded fixtures,不宣稱任意 codebase 準確度);atomic rebuild 失敗不會炸掉上一版有效 index
解決的需求:Media Gap Analysis:資料庫掃描說「缺 196 條」,但檔名/標題字面匹配大量誤配(no118 被誤配到話774,正確是話40;同名標題在重播版間重複)。改用影片標題卡 OCR 實錘——直接讀畫面裡的標題文字與官方話數表比對,標題卡不會說謊。
實作與成果:
- 演算法:LCSS 字元數優先匹配(修正「母ちゃんのお宝を探すゾ」誤配話743→正確話812)、LIS 序列推斷剔除離群值、相容帶過濾(0.40×no±50)、三輪信心分級
- 爬蟲/解析:維基話數表語義判別器(303 行純 stdlib)——可變欄序、職員黑名單、重播旗標、SPECIAL/傑作選邊界
- 資料庫處理:8 種命中來源合併去重(737 唯一 no)、全局話數倒退偵測、報告與 CSV 0 不一致
- 工具調用:ffmpeg 抽幀/3x 放大、tesseract 分區選語(jpn/chi_tra)、環境變數全參數化
- 實測規模:2270 檔 / 196 條缺集 / 100% 定稿,全數高信心,0 待查;純標準庫零第三方依賴
解決的需求:b9128:把論文數學的完美性落地到 CUDA GPU,跨功能整合實作、執行、驗證——CUDA、PPL、記憶體、吞吐。它真正處理的是 Oracle 資料管線的準確性:面對 CUDA 黑盒子,用最小的探針定位抖動、隔離變數、確保每一筆資料在管線中流通無損。
實作與成果:
- 對應生成的不同位置:11 個功能分別對應語言生成流程的各個環節
- 適配最新技術:每個功能對應目前網路上最新的模型與推理功能
- 由深到淺、由淺到廣:從最深層的 kernel 到最廣的系統整合,逐步套用並通過分層驗證
- RTX 5090 實測結果:WHT 27/27 backend 測試通過、MoE 764/764 測試案例通過、KV cache buffer 50 MiB vs 256 MiB(n_ctx=4096)、Turbo3 在 FA on/off 下測得相同 PPL(delta 0.0000);FA4 則被保留為
Blocked / Not accepted——沒通過的誠實標記,也是證據鏈的一部分
解決的需求:Video20 AI Workbench:保留 prompt、model branch、fingerprint、source identity,現在的設定不能回頭污染歷史 output。
實作與成果:
- 完整管線:文字生圖片 → 圖片生影片,一條龍
- 可控導入:三視圖控制導入的產品或建築物;可導入 LoRA 控制圖片、建築物,甚至環境
- 版本管理是核心:20 張圖片生成完之後,任何一張不滿意可單獨重新生成,不必整批重跑;影片同樣可單獨重生成——任一 segment 獨立重生不會破壞其他 segment,歷史 generation provenance 保留
- UI 管理與環境監看:在 UI 介面管理後台輸出產品,並查看生成當下的上下文、知識庫等資料現況——整個環境狀態一目了然
- 驗證:35/35 治理測試全過,7 條模型分支端到端跑通
解決的需求:TRI-100R / AI Collaboration Forensics:我與 AI 交互留下的全部資訊,由我自己標示重要的地方——PLANNED_NOT_EXECUTED、HYPOTHESIS、MENTIONED 不能偷偷升格成完成;我做的 Gate 也會阻止我自己亂宣稱成果(151 張卡 → 論文資格 0)。這不是解決問題的細節,而是語言模型下一步該學的:以證據推進、維持整個架構不崩潰。
實作與成果:
- 偵測 AI 偷偷改寫目標的漂移,砍掉沉沒成本,一天內恢復專案
- 可追蹤的資料管線:58,070 行原始 ledger → 31,112 canonical records → 31,112 trace index → 19,827 claim registry → 19,827 master timeline → 6,319 method cases → 3,960 conflicts → 197 審查收據——把不可靠的自然語言紀錄轉成 machine-readable state database,每一行都有來源與狀態
解決的需求:Personal Context OS:AI 執行以前,Purpose、Criteria、Boundary、Current State 該由誰保管,而不讓 Skills 自己變成 Source of Truth。
解決的需求:Codex Personal Skills:skills 太多、太繁雜、人類記憶困難,但它們都是重要功能。路由是 skills 與 AI 之間的潤滑劑——結構化每個 skill 的關係、調用規則與邊界,一鍵啟動正確的能力,我不需要記住所有調用細節;真正需要時,AI 反而會告訴我該怎麼解決。
解決的需求:FunClip Local Editor(規劃中):source identity、immutable reference、human review、rollback、Data Oracle 全部收斂進一個 end-user 剪輯工作台。
解決的需求:AI Engineering Journal:記錄「目標接管」——AI 偷偷把「找出正確版本」換成「修好目前版本」——的真實案例與解法,把這些經驗組織成可以閱讀的路線。每篇文章標記成熟度(CASE STUDY、ARCHITECTURE、ROADMAP、PRODUCT SPEC、RESEARCH PROPOSAL),提案永遠不會被講成完成。
實作與成果:
- 7 篇文章形成一條路線:真實事故 → 產品設計 → 理論 → 領域實作 → 通用框架 → 架構藍圖 → 學習路線圖
- PROJECT_ECOSYSTEM.md 完整專案關係圖:上下游關係與本機工作副本界線一目了然
- 每篇文章自帶中英雙語入口,不必照順序閱讀
人機交互是 AI 工程最真實的材料,而 AI 與人類合作的原始對話軌跡就是它的原始碼。
我把每一段人機協作都當成資料庫問題處理——逐行保留來源、狀態、追蹤與去識別保全, 不允許「說過的」變成「做過的」。這一方面展現我對資料庫處理的能力(58,070 行的 TRI-100R 全量重建、29 GB 的協作快照鑑識),另一方面也展現我對語言模型該如何訓練的 品味:只有能分辨「計畫、假設、提及與真實執行」的語料,才值得教給模型。
完整說明見 AI Engineering Journal 的專案生態。
Lin Juhon | 桃園・台北 xup65k6cjo22@gmail.com


