【大模型/评测】近期大模型发布与评测要点如下:
GitHub 上 21 万 star 的开源项目 ECC(affaan-m/ECC),是给 AI 编程助手做 "性能优化" 的系统,相当于给 Claude Code、Cursor、Codex 这些 agent 装上一套 "操作系统"。 它能干什么: 1、开会话前先规划:/plan 自动拆解需求出实施方案,/code-review 审查代码质量,/build-fix 修构建错误,/security-scan 做安全审计,全程 TDD 流程强制测试先行 2、越用越懂你:它会在后台记录你的每次操作,自动学习你的编码习惯(比如你纠正过 "用函数式而不是类",下次它就会记住),跨项目、跨会话沉淀成可复用的 "本能" 3、记忆不丢:新开一个会话,自动加载上次的会话摘要和项目相关经验,不用每次重新交代上下文 4、一个系统跑所有工具:同一套技能和规则,装一次就能在 Claude Code、Cursor、Codex、OpenCode、Gemini、Kimi 等十几个 harness 里用 5、省钱:内置 token 优化策略(默认模型路由、压缩时机、上下文监控),官方说能省 60% 成本技术特点 1、"本能(Instinct)" 学习机制:把学到的经验拆成原子化的行为单元(一个触发条件 + 一个动作),每条带置信度评分(0.3 试探 → 0.9 近乎确定)和证据链;用户纠正就降分、反复验证就涨分。观察用 hooks 确定性采集(100% 不漏),分析交给后台轻量模型,不占主上下文 2、记忆分层隔离:经验按项目隔离,用 git remote URL 哈希成项目 ID,换机器也能对上号;同一经验在多个项目反复出现且置信度高,自动升级为全局规则。注入上下文前还会按项目技术栈做相关性排序,只喂最相关的 3、一套代码适配所有 harness:各家工具的钩子事件格式不同(Cursor 20 种、Claude 只有 8 种),它用一个 adapter 层做格式归一化,核心逻辑零重复 4、安全守卫设计反套路:GateGuard 不问你 "确定吗"(LLM 永远说确定),而是强制你在改文件前列出影响范围、引用用户原话;AgentShield 有 102 条静态审计规则 + 1282 个测试,还能调 3 个 Opus agent 做红蓝对抗审计 5、工程化程度高:997+ 内部测试防回归、文件写入用锁 + 原子操作、损坏数据自动修复,下一代控制面已经用 Rust 重写(SQLite 会话存储 + 终端仪表盘) 适合重度使用 AI 编程助手的人:装一个,等于给 agent 装上了 "记忆 + 学习 + 纪律 + 安全" 四件套。 仓库地址 github.com/affaan-m/ECC,MIT 协议。 HOW I AI程序员
Miles v0.1 开源了:一套现成的"大模型训练流水线",让企业自己训专属模型这件事,从烧钱赌博变成工程问题,属于SGLang 系那帮人做的开源 RL 后训练框架。 以前想让模型学会干你公司的活(写代码、操作软件、处理客服),要么找大厂定制,要么自己养一支底层团队从零搭,Miles 把这套东西打包好了,Docker 一键起,换上你的数据和任务就能训。 记得三个月前我预测未来每家公司都会拥有自己的模型,否则就是模型公司的养料,miles能帮企业往前更进一步: 1、能训练"干活的"模型,不只"会聊天的" 它的重点是 agentic RL——让模型在真实环境里反复试错,学会用工具、操作终端、完成多步任务——你想要的是一个能替你干活的 AI 员工,不是一个话痨 2、大模型也能在这个框架上跑 paper里提到:744B参数的 GLM-5.2,跑编程任务,64 张卡,每一步训练 4 分多钟。这个开源框架已能支撑训练千亿级模型,这在以前是大厂专利。 3、训练过程不容易崩大规模 RL 最痛的是跑到一半挂掉,几十万电费打水漂。Miles 在稳定性上下了很多功夫,Modal 也是它的客户,评价是"长时间运行一直很稳"。 4、一套框架搞定所有训练类型 SFT(喂数据)、RL(试错学习)、蒸馏(大模型教小模型)、LoRA(省钱的轻量训练),一套代码全包不用东拼西凑。 5、数据本地化跑在本地机器,数据、模型模型权重、训练记录全在自己手里,对金融、医疗、政府这类客户,这是刚需。 6、支持主流模型 DeepSeek、Qwen、GLM、Kimi、Gemma、Nemotron 都有现成配方,新模型发布当天就支持,N 卡、AMD 卡都能跑。 7、被真实客户验证过 Periodic Labs 用它在几千张卡上训万亿参数模型,Modal、IBM、Decagon、Nebius 都