博客
平时沉淀的长文,参考多角度的观点,欢迎分享你的见解。 共 2 篇。
全部归档
按主题浏览2026
三个 Claude Code 实现:一份 Agent 工程笔记
一份来自三个实现的 Agent 工程笔记。CoreCoder 是 Python 手写的最小实现,Claude Code 是生产实现,learn-claude-code 是教学实现。内容覆盖 Agent Loop 的流转条件与中断修复、工具定义与文件编辑策略、上下文注入与三档压缩、QueryEngine 的长期状态、并行工具与子 Agent、Hook 与 Task 扩展点、多 Agent 协作、记忆 / MCP / 后台任务 / 定时任务,以及路径与命令的安全防线。
27 分钟阅读
Transformer 学习笔记:从整体架构到多头注意力
一份 Transformer 的学习笔记,按先整体再拆件的顺序整理:编码器与解码器的数据流;学大模型前需要回答的三个问题(神经网络、注意力机制、PyTorch 组成);Token、词嵌入矩阵与位置编码各自解决什么问题;Q、K、V 的含义,Q·K 点积为什么代表相关性,softmax 前为什么要除以维度的平方根;自注意力与交叉注意力的区别,以及交叉注意力为什么不需要掩码;训练时并行预测多个 token 而推理时逐 token 生成,因此需要因果掩码防止偷看,做法是把后文置为负无穷再经 softmax 变成 0;前馈网络、多头注意力与层归一化的定义,包括层归一化与批量归一化在归一化维度上的差别。
12 分钟阅读