Harness
Codex、Claude Code 与已审批 Skill 各自运行时,路由、权限、长任务和交付状态缺少一个可审计的控制面。
统一 execute / watch 接口,覆盖工作流与角色分工、预算审批、暂停恢复、事件账本和隔离 worktree。
这里主要记录我在做 AI 应用时反复遇到的问题:任务怎么定义、Agent 怎么编排、 Prompt 怎么维护、体验怎样才算真正可用。
四个真实项目,分别回应 Agent 控制、框架学习、知识检索与技术内容生产。
Codex、Claude Code 与已审批 Skill 各自运行时,路由、权限、长任务和交付状态缺少一个可审计的控制面。
统一 execute / watch 接口,覆盖工作流与角色分工、预算审批、暂停恢复、事件账本和隔离 worktree。
大型框架的抽象会遮住 Agent 的核心机制,新手很难看清模型决策、工具执行与消息回填如何构成闭环。
从最小 Agent 循环扩展到 memory、trace、guardrails、RAG、workflow、受控 multi-agent 与确定性 eval。
私有资料上传后仍散落在文件与会话中,缺少可维护的解析、索引、检索和连续对话链路。
文档上传与任务构建、稠密检索、会话记忆、Provider 路由与故障切换,并提供真实 Milvus E2E 验证路径。
从日报、笔记与外部来源到可发布内容,研究证据、人工审批、长任务恢复和成本边界尚未串成稳定流程。
计划覆盖材料导入、引用核验、三段审批、文章与短视频生成、质量检查及完整发布包导出。
我更在意怎样把 AI 能力接成一条真正能长期维护的产品链路。
在开始接模型前,先定义用户到底想完成什么、结果怎样算好、什么情况下应该中断或交还给人。
我会同时关注输入结构、上下文装配、输出 schema 和版本管理,让 prompt 可以被维护、测试和比较。
面对 agent、tool use 和 automation,我更关注状态暴露、失败路径、权限边界和人工接管,而不是单纯追求自动化感。
每次迭代都尽量留下问题、改动、观察和结果,慢慢形成一套能复用到下一版产品里的方法。
从公开来源筛选每天值得继续跟踪的 AI 信号,保留事实、判断、原始链接和行动建议。
这里记录的不是大而全的教程,而是我在做 AI 应用时反复碰到的具体问题、判断和复盘。
把上下文视为最小充分工作集,把记忆视为有进入、更新、验证和退出机制的工作资产。
模型输出只是能力起点,真正决定体验的是任务边界、反馈、容错与成本控制。
多步任务的可靠感来自进度可见、中间状态清楚、失败能回退,而不是让 agent 看起来更自动。
更稳定的 AI 应用,往往来自输入 contract、输出 schema、版本管理和评估方式,而不是灵感型 prompt。
我想用这个网站持续记录 AI 应用开发中的实验、复盘和方法沉淀,而不只展示最后成品。
我希望这个站点慢慢长成一个关于 AI 应用开发的方法索引,而不只是个人介绍页。
我关注 AI 能力和产品体验之间那段最容易失真的地带:需求怎么收束、交互怎么解释不确定性、 工具怎么配合、结果怎么被用户信任。
所以这里会同时出现产品思考、界面决策、prompt 设计、agent workflow、评估方法和一些实现层面的记录。 它们对我来说不是分开的模块,而是同一条开发链路。
如果你也在做 AI 应用、Agent 工具或面向真实任务的智能工作流,希望这个站点能慢慢成为一个能交换经验的地方。
欢迎从一个具体问题开始交流,比如任务边界、信息架构、prompt 接口、状态设计、 评估方式,或者原型到前端落地的路径。
这些联系方式先保留占位,后面可以直接替换成真实入口,不影响现在继续写和继续发。