⚡ AI 编程提效 · 实操方案

不是新闻汇总,是可落地的工具选型 + 工作流 + 配置模板 · 多源整合(AIHOT、Databricks/Composio 实测、各工具官方实践)

引言:先纠正三个反直觉认知

① 提效 ≠ 换更强模型,选对「Harness」才是关键。
Databricks 在自己百万行代码库上实测:同一个模型塞进不同 Harness,每个任务成本能差 2 倍以上,质量却几乎一样。端到端的工程账,往往「强模型 + 高效 Harness」比「便宜模型 + 臃肿 Harness」整体更便宜。
② 省 token = 省时间 + 省钱。
极简 Harness(如 pi)每 turn 发出去的上下文只有别人的 1/3,工作集更紧凑,更少的来回就把活干完。Composio 用 DeepSeek-V4-Flash 跑 8 个 Harness 的 30 个高难任务:pi 通过 20/30,每个成功任务成本仅 $0.028,是所有 Harness 里最便宜的
③ 最大的提效杠杆是「上下文工程」,不是「模型参数」。
AI 智能体不会主动读文档、不会猜你的项目约定。你喂给它的上下文质量,直接决定产出质量。AGENTS.md、项目规则、技能文件,是性价比最高的投入。

一、工具选型(按场景挑,不要贪多)

工具定位适合场景一句话建议
Claude Code最强 agent CLI复杂重构、跨文件任务、长任务质量优先的首选,配 Opus 级别模型
CodexOpenAI 官方 CLI日常编码、快节奏迭代和 ChatGPT 生态打通,跨会话传消息好用
CursorIDE 集成(已并入 SpaceXAI)边看边写、可视化 diff/审查不习惯纯终端的话用它最顺手
OpenCode开源、可自托管要数据可控、自建环境的团队provider-agnostic,免费灵活
pi极简 Harness配便宜模型省钱、极客定制上下文纪律最好,成本最低,但需自己拼扩展
GitHub Copilot轻量补全随手补全、小片段别指望它做复杂任务,定位是「补全」

关键:别同时装一堆工具。选 1 个主 agent CLI(Claude Code / Codex / OpenCode 三选一)+ 1 个 IDE 辅助(Cursor / Copilot),就够了。

二、工作流:把 AI 当「员工」管,不是当「补全」用

第 1 步:用 AGENTS.md 固化项目规范

AI 不会主动读你的代码风格、目录约定、技术栈限制。把这些写进仓库根目录的 AGENTS.md(或 CLAUDE.md),它每次启动都会读。这是性价比最高的一步。

第 2 步:跑「四步循环」,不要一句话丢给它就跑

  1. Plan:先让它说清楚「打算改什么、为什么、影响哪些文件」
  2. Code:确认计划后再动手
  3. Review:让它自审 diff,或派第二个 agent 审查
  4. Test:跑测试、验证,不通过就回炉

第 3 步:大任务拆小,用子代理并行

一个 500 行的需求,拆成 3-5 个独立子任务并行跑(explorer 探索 + fixer 修复 + reviewer 审查,各自指定不同档位的模型),比一个大 agent 硬啃又快又稳。关键:子代理只回传摘要,别把几千行日志灌回主上下文

第 4 步:跨会话交接 + 让 AI 接管日常维护

三、上下文工程(最大的提效杠杆)

AGENTS.md 模板(可直接复制到项目根目录)

# AGENTS.md

## 项目概述
<一句话说明项目是做什么的>

## 技术栈
- 语言:Java 11 / Python 3.11 / TypeScript ...
- 框架:Spring Boot 2.7 / FastAPI ...
- 构建:Maven / Gradle / npm ...

## 目录结构约定
- 业务代码放 src/main/...
- 测试放 src/test/...
- 禁止修改的目录:docs/(只读)

## 代码规范
- 命名:类用 PascalCase,方法用 camelCase
- 每个 service 必须有对应测试
- 日志用 SLF4J,不要 System.out

## 常用命令
- 构建:mvn clean install
- 测试:mvn test
- 启动:mvn spring-boot:run

## 注意事项
- 数据库字段命名统一 snake_case
- API 返回统一用 CxResult 包装
- 不要引入新的依赖,除非明确说明理由

上下文纪律(省 token 的核心)

四、真实提效数据(这些是实测,不是营销)

📊 Harness 决定成本:Databricks 实测同一模型不同 Harness,每任务成本差 2 倍+,质量几乎一样。
💰 最便宜组合:Composio 测试,pi + DeepSeek-V4-Flash 通过 20/30 任务,每个成功任务 $0.028;对比 Hermes $0.056、Prime $0.131。
🖥️ 智能体真会用电脑了:a16z 数据,计算机操作智能体在 OSWorld 基准最佳成绩一年从 42% 涨到 80%+。
🔧 维护自动化:实践者让 Claude 接管应用日常维护,数周自动开出 388 个 PR(崩溃测试、重复代码统一、死代码清理)。

五、7 天落地清单(照做就能见效)

动作预期效果
Day 1选一个主 agent CLI,装好并跑通第一个任务熟悉基本用法
Day 2给你的主力项目写一份 AGENTS.mdAI 不再瞎猜你的规范,产出质量立升
Day 3强制自己用「Plan → Code → Review → Test」四步循环减少返工,任务一次通过率提升
Day 4把一个 300+ 行需求拆成 3 个子任务并行跑体验并行提速
Day 5让 AI 接管一件日常维护(死代码清理 / 补测试)省下重复劳动
Day 6对比不同模型档位(便宜模型 + 高效 harness)算笔账找到成本/质量平衡点
Day 7把常用流程沉淀成 skills / 规则文件,固化下来形成你自己的提效体系