AI Engineering¶
本區整理 AI、AI Agent、RAG、Context Engineering、Claude Code 與工具化工作流的公開筆記。內容偏向工程實作、系統設計與個人知識管理,而不是泛用名詞介紹。
主題地圖¶
30 篇分成七個主題,依「輸入 → 系統 → 營運」排列:先決定餵給模型什麼,再讓它讀得到、做得到,最後才是評估與維運。每個主題節點列出該分組的文章。
Start Here¶
- Prompt Engineering 核心技術:Chaining、CoT 與 Loop
- Context Engineering:超越 Prompt Engineering 的下一個前線
- RAG 完整指南:檢索增強生成的原理、架構與實作
- Claude Code 寫程式準則:Andrej Karpathy 版本整理
Learning Paths¶
上面的地圖可以直接點選前往。這份清單保留完整內容——它同時是站內搜尋的索引來源,也是 JavaScript 未載入時的備援,因此不隨地圖移除。
展開完整清單(含一句話導讀)
Prompt 與 Context 工程¶
- Prompt Engineering 核心技術:Chaining、CoT 與 Loop
整理 Prompt Chaining、CoT 與 Loop 等核心技術與使用時機。 - Context Engineering:超越 Prompt Engineering 的下一個前線
把注意力從單次 prompt 擴大到上下文配置、記憶、工具結果與資訊流設計。 - Context Engineering 實作篇:Context Budget、Memory、Retrieval 與 Tool Result 壓縮怎麼組合
Context Engineering 實作篇:四個槓桿怎麼組合。 - Reasoning Models 與 Test-time Compute:把算力花在推論,以及過猶不及
講 Test-time Compute 推理模型原理與想太多的反效果。
RAG 與檢索系統¶
這六篇是一個有順序的系列,依下列站點閱讀;每篇開頭都會標明自己在第幾站。
- 第 0 站|Fine-tuning vs RAG vs Prompting:何時用哪個(決策框架)
進門前先問該不該進門:prompting 改指令、RAG 改知識、fine-tuning 改行為。 - 第 1 站|RAG 完整指南:檢索增強生成的原理、架構與實作
走完索引/檢索/生成三階段管線,建立骨架與詞彙;含生成端 Prompt 設計與最小可行實作。 - 第 2 站|Embeddings 與向量資料庫實務:模型選型、ANN 索引與生產考量
檢索底層:embedding 模型選型、向量庫比較、HNSW/IVF 取捨與生產維運。 - 第 3 站|RAG 進階系列:Chunking、Hybrid Search、Reranking、Query Rewriting、Citation 與 Freshness
把 naive RAG 推向生產級的六個槓桿,附落地優先序。 - 第 4 站|GraphRAG:用知識圖譜做檢索——適合什麼、代價是什麼
換架構之一:換「索引什麼」。擅長跨文件連點與全局摘要,代價是前處理與延遲。 - 第 4 站|Agentic RAG(2026):從固定檢索到自我修正的檢索迴圈
換架構之二:換「誰決定何時檢索」。內含全系列共用的 RAG 架構光譜比較表。
第 4 站的兩篇是平行分岔,不分先後;先確認第 3 站的槓桿都加過,再考慮換架構。
Agent 工程¶
- AI Agent Harness Engineering 實作指南
建立 Agent 測試、評測、觀測與上線 gate 的工程框架。 - Coding Agent 工作流:從 Issue 到 PR 的實際 SOP
整理 Coding Agent 從 Issue 到 PR 的六階段 SOP。 - Structured Output 與 Tool Use 機制:JSON Schema、Constrained Decoding 與可靠性
拆解 Structured Output 與 Tool Use 的可靠性機制。 - Multi-Agent 協作:Orchestration 模式、通訊協定與失敗隔離
整理 Multi-Agent 編排模式、通訊協定與失敗隔離設計。 - AI Agent 安全與權限:Browser、File、Shell、GitHub、Gmail 的工具權限怎麼控管
拆解 Agent 工具權限風險,逐工具給出控管建議。
評估、記憶與觀測¶
- LLM Evaluation 實務:RAG 評估、Agent Trajectory 與 LLM-as-Judge 偏誤
建立評估 LLM 系統的基礎地圖:什麼層次用什麼指標,LLM-as-judge 的限制。 - LLM Evaluation 進階:Cost-Aware 評估、線上 A/B 與離線指標的對齊
把成本納入評估決策,以及離線評估怎麼和線上 A/B 結果不失真地對齊。 - Agent Observability:用 Trace 看清 Agent 在做什麼
線上觀測 agent 的 trace、cost、latency 與 failure mode,和離線評估互補。 - Agent Memory 系統:短期/長期記憶、向量記憶與記憶腐化更新策略
Agent 記憶的四種類型、向量記憶架構,以及記憶腐化的三種壞法和對應更新策略。
Claude Code / Skills / MCP¶
- Claude Code 寫程式準則:Andrej Karpathy 版本整理
整理 Claude Code 在程式開發任務上的使用準則與互動心法。 - Superpowers:把資深工程師紀律編碼成 Markdown 的 Skill 框架
介紹如何用 Skills 把 TDD、debugging、planning 等工程紀律外顯化。 - Claude Code 紀律框架對比:Superpowers / GSD / gstack
比較不同 Claude Code 工作流框架的定位、優缺點與適用情境。 - Anthropic Agent Skills 與官方 Document Skills(PDF / DOCX / PPTX / XLSX)
介紹 Agent Skills 架構與官方文件處理 skills 用法。 - MCP 生態系指南:Server 類型、Local vs Remote、Auth 與 Security Boundary
MCP 概念地圖:Server 類型、遠端 vs 本地與信任邊界。 - MCP Builder:用 Skill 引導蓋出生產級 MCP Server
介紹如何用 Skill 流程引導 MCP Server 的規劃、實作與驗證。
成本與 Token 優化¶
- 9Router:把 Claude Code、Cursor、Codex 接上 40+ AI Provider 的本機路由器
本機路由器接 40+ AI Provider,格式轉譯並砍 Token。 - Caveman:把 Agent 輸出壓掉約 65% Token 的 Claude Code Skill
介紹用穴居人語氣把 Agent 輸出壓縮約 65% Token 的 skill。 - Prompt Caching:用前綴快取砍掉成本與延遲
講 Prompt Caching 原理、怎麼擺,與悄悄破壞快取的坑。
用 AI 維護知識庫¶
- 用 CLAUDE.md 把 AI 變成你的 Obsidian 知識庫維護者
說明如何用 CLAUDE.md 定義知識庫維護規則,讓 AI 協助整理與發布筆記。 - 我的 Obsidian Vault CLAUDE.md 原文
公開我實際使用的 Obsidian Vault CLAUDE.md,作為前一篇的範本附件。