跳转到内容
首页/博客

博客

平时沉淀的长文,参考多角度的观点,欢迎分享你的见解。 共 2 篇。

全部归档

按主题浏览

2026

三个 Claude Code 实现:一份 Agent 工程笔记

一份来自三个实现的 Agent 工程笔记。CoreCoder 是 Python 手写的最小实现,Claude Code 是生产实现,learn-claude-code 是教学实现。内容覆盖 Agent Loop 的流转条件与中断修复、工具定义与文件编辑策略、上下文注入与三档压缩、QueryEngine 的长期状态、并行工具与子 Agent、Hook 与 Task 扩展点、多 Agent 协作、记忆 / MCP / 后台任务 / 定时任务,以及路径与命令的安全防线。

27 分钟阅读AgentClaude Code源码阅读工程实践
Transformer 学习笔记:从整体架构到多头注意力

一份 Transformer 的学习笔记,按先整体再拆件的顺序整理:编码器与解码器的数据流;学大模型前需要回答的三个问题(神经网络、注意力机制、PyTorch 组成);Token、词嵌入矩阵与位置编码各自解决什么问题;Q、K、V 的含义,Q·K 点积为什么代表相关性,softmax 前为什么要除以维度的平方根;自注意力与交叉注意力的区别,以及交叉注意力为什么不需要掩码;训练时并行预测多个 token 而推理时逐 token 生成,因此需要因果掩码防止偷看,做法是把后文置为负无穷再经 softmax 变成 0;前馈网络、多头注意力与层归一化的定义,包括层归一化与批量归一化在归一化维度上的差别。

12 分钟阅读Transformer深度学习注意力机制学习笔记

向本站提问

常见问题Esc 关闭 · 向本站提问