Harness
Codex、Claude Code 与已审批 Skill 各自运行时,路由、权限、长任务和交付状态缺少一个可审计的控制面。
统一 execute / watch 接口,覆盖工作流与角色分工、预算审批、暂停恢复、事件账本和隔离 worktree。
最近在做的四个项目,涉及 Agent 任务执行、运行机制、个人知识库和投资研究。
Codex、Claude Code 与已审批 Skill 各自运行时,路由、权限、长任务和交付状态缺少一个可审计的控制面。
统一 execute / watch 接口,覆盖工作流与角色分工、预算审批、暂停恢复、事件账本和隔离 worktree。
大型框架的抽象会遮住 Agent 的核心机制,新手很难看清模型决策、工具执行与消息回填如何构成闭环。
从最小 Agent 循环扩展到 memory、trace、guardrails、RAG、workflow、受控 multi-agent 与确定性 eval。
私有资料上传后仍散落在文件与会话中,缺少可维护的解析、索引、检索和连续对话链路。
文档上传与任务构建、稠密检索、会话记忆、Provider 路由与故障切换,并提供真实 Milvus E2E 验证路径。
个人投资决策需要明确的事实边界、可恢复的运行时和可审阅的风险约束;第一阶段必须先证明系统不会把不完整数据或模型输出误写成公开建议与交易。
Python 应用宿主、Pinned M-Agent 0.5.0 Runtime、启动冻结配置、分离 SQLite 状态、CLI / FastAPI 诊断契约与 React / PWA 壳层。
记录每天关注的 AI 新闻、开源项目和社区讨论,附上原文链接,也写一点自己的看法。
读源码和做实验时留下的笔记:一个机制怎么实现,为什么这样设计,还有哪些地方没弄清楚。
围绕「Agent Evaluation 怎么设计:从一次失败到持续回归门禁的八个决策」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
围绕「Agent Framework 怎么设计:从隐式循环到可恢复运行时的八个决策」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
围绕「Context Engineering 怎么设计:从消息堆积到可审计工作集的八个决策」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
围绕「Agent Memory 怎么设计:从失败证据到可验证选型的八个决策」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
围绕「AgentBench 的评测实践:一个学术综合基准的框架、调度与确定性判定」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
围绕「Caveman Compression 的实践:用「可预测性」做语义压缩的三种实现与批判性审视」的源码导向研究笔记,记录核心机制、系统边界与可复用的工程判断。
一点个人背景,以及为什么做这个网站。
我的专业是计算机科学与技术,目前主要研究和开发 Agent: 一边读开源项目的实现,一边在自己的项目里尝试和验证。
开发过程中,我尤其关注任务中断后的恢复、工具调用的权限,以及执行结果的检查。 比如,任务重启后如何避免重复操作,哪些步骤应该交给人确认,又该用什么测试判断任务是否完成。
做这个网站,是想把散在仓库和笔记里的东西放到一起,方便自己回头查, 也方便和有相似兴趣的人交流。项目做到哪一步、试过什么、还有什么没解决,都会尽量写清楚。
你也在做 Agent,或者对这里的某个项目、某篇笔记有想法,都可以联系我。 问题、建议和不同意见都欢迎。
可以发邮件,也可以在对应的 GitHub 仓库提 issue。