Skip to content

LLM Wiki 规格说明(Spec v1.0)

一份可对外传播的 LLM Wiki 实现规格。基于 Karpathy 的 LLM Wiki(编译器模式)+ 社区 V2 实践(置信标记、矛盾消解、回答验证、过时清理)。任何人可依照本规格实现自己的 LLM Wiki。

1. 概述

1.1 是什么

LLM Wiki 是一种由 LLM 协作维护的 Markdown 知识库模式:知识在摄入时被编译成结构化的互链词条,而不是在查询时由 RAG 现场检索拼装。

核心公式Agent = Model + Harness;知识管理同理:Wiki = Sources + Rules + Compile

1.2 为什么(编译器 vs 解释器)

维度传统 RAG(解释器)LLM Wiki(编译器)
时机查询时检索+推理摄入时编译成词条
积累问完就丢,无复利好答案沉淀,复利增长
一致性文档可自相矛盾编译时消解矛盾
成本每次重复计算命中即答,token 省
规模适合大规模语料词条库 5-10 万 token 内最优

1.3 适用范围

  • 个人/团队知识库(几十到几百词条)
  • 技术文档、调研笔记、会议纪要、学习记录
  • 不需要向量检索的场景(词条规模下 grep + 阅读更快更可靠)

2. 设计原则

  1. 纯 Markdown 真相源:知识只存在于 Markdown 文件,不绑定任何工具
  2. 摄入时编译:新知识写入时即编译成语义词条
  3. 源材料不可变_raw/ 只进不改,更新走"新版本摄入"
  4. 词条互链成网:双向链接是知识图谱
  5. 规则驱动维护:一切维护行为由规则文件约束(LLM 遵守、人监督)
  6. 最少机制:不加词条规模用不上的基础设施(向量库/评分引擎)

3. 目录结构规范

<wiki-root>/
├── purpose.md              # 定位锚点:知识库为谁、边界、维护规则(LLM 每次操作先读)
├── README.md               # 人类读者入口
├── _raw/                   # 源材料(不可变,或仅记录来源链接)
├── wiki/                   # 词条目录(按实体类型分域)
│   ├── concepts/           # concept 词条
│   ├── tools/              # tool 词条
│   ├── comparisons/        # comparison 词条
│   ├── patterns/           # pattern 词条
│   ├── persons/            # person 词条
│   ├── events/             # event 词条
│   └── <domain>/index.md   # 每域一个导览索引
├── guide/                  # 方法论:本规格、词条模板、写作指南
└── index.md                # 知识地图首页(可选,取决于渲染器)

4. 实体类型规范

类型适用必含章节
concept术语、理论、范式定义 / 核心机制 / 演变 / 关联词条
tool框架、产品、软件定位 / 基本信息 / 核心特性 / 架构 / 生态 / 优缺点
person人物、团队简介 / 代表贡献 / 相关词条
event发布、里程碑时间线 / 影响 / 相关词条
comparison多对象对比对比维度表 / 关键差异 / 选型建议 / 关联词条
pattern设计模式、实践定义 / 适用场景 / 步骤 / 变体 / 关联词条
overview专题导览、领域总览专题地图 / 阅读路径 / 关联词条

5. 词条格式规范

5.1 Frontmatter(必填)

yaml
---
title: 词条标题
type: concept            # concept | tool | person | event | comparison | pattern | overview
date: YYYY-MM-DD
tags: [tag1, tag2]
sources: [来源URL或_raw路径]
status: draft            # draft | published | outdated
---

5.2 置信标记(V2)

每个关键事实在句中或表内标注:

标记含义
stated原文引用/转述
high多方确认或经实践验证
low推断、单一来源、未验证

5.3 关联词条区(强制)

词条末尾必须有:

markdown
## 关联词条
- [词条A](path/to/a.md)(type)
- [词条B](path/to/b.md)(type)

6. 编译流水线

用户投喂材料(文章/链接/笔记)
  → ① Ingest 摄入:登记到 _raw/ 或记录来源,源不可改
  → ② Classify 分类:判定实体类型与归位域
  → ③ Compile 编译:先分析(提炼结构化要点)→ 再生成(按模板写词条,去营销话术)
  → ④ Link 互链:写关联词条区,更新域索引与知识地图
  → ⑤ Build 发布:渲染站点(可选),验证可达

7. 维护规则(LLM 必须遵守)

  1. 摄入时编译:外部材料 → 实体词条,不搬运原文
  2. 置信标记:关键事实带 stated/high/low
  3. 矛盾必消解:新来源与旧词条冲突 → 重写为当前真相 + 记录变更,不囤积对立版本
  4. 回答前验证:回答查询前必须 list/grep 确认存在性,禁止凭记忆断言"没有"
  5. 互链强制:词条必须有"关联词条"区
  6. 过时即删:定期 lint 清理不再为真的词条(标记 outdated 或删除并清理互链)
  7. 定时维护(可选):调度 agent 定期跑 lint、消解矛盾、综合模式

8. 查询与复利

  • 查询:从词条回答(带置信标记);优质问答归档(promote)为词条或补进现有词条
  • 缺口补全:知识缺口 → 网络搜索 → 摄入 → 编译(research-on-miss)

9. 工具链建议

推荐说明
词条存储Markdown 文件 + git唯一真相源,版本可回退
渲染器VitePress / Obsidian / Logseq纯展示层,可随时更换,知识零损失
维护 AgentClaude Code / DeepSeek Harness / Codex CLI任一 agent + 规则文件即可
技能封装SKILL.md(agent 技能格式)把本规格固化为可复用技能

10. 参考实现

  • linwiki(本知识库):VitePress + DeepSeek Harness + llm-wiki skill
  • karpathy-wiki:Obsidian + Claude Code 实现(GitHub
  • obsidian-second-brain:长期实操版(GitHub

11. FAQ

Q: 需要向量检索吗? 不需要。词条库 5-10 万 token 内,grep + 阅读更快更可预测。

Q: 词条与文档有什么区别? 词条是结构化的"预编译答案"(按类型模板 + 互链),文档是线性文本。LLM Wiki 只存词条。

Q: 规模大了怎么办? 词条数量超过几百后按域继续细分;向量检索是最后才考虑的手段。

12. 参考