DC娱乐网

【大模型/评测】 近期大模型发布与评测要点如下: 我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自 ​

【大模型/评测】近期大模型发布与评测要点如下:

我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自己检查、自己合并,第二天早上她再抽查。 不 Review 不等于不管质量,她靠另外两个办法来保证: 一是让 AI 能像真人用户一样把程序用一遍,自己发现问题; 二是给代码定下很多规矩,让 AI 很难写出烂代码。 她把自己这套做法写成了一组 Skill,公开了出来,叫 pstack。 顺便说一下,这期播客的主持人 Matt Pocock 原本是知名的编程课讲师,他公开的技能库在代码托管网站 GitHub 上有二十多万个星标,是最受欢迎的技能库之一,所以这期算是两位同行对谈。Lauren 之前在 Meta 做网页开发框架 React,今年 3 月加入 AI 编程工具公司 Cursor;Cursor 今年 8 月被 SpaceX 收购,并入旗下的 AI 部门 SpaceXAI。 根据播客的内容,我把 Lauren 的这套做法简单总结一下,我自己的点评在结尾处。 一、先让 AI 能检查自己干的活 Lauren 说,就算不用她的 pstack,每个人最该有的一项技能也是“验证”:给 AI “手和眼睛”,让它能把自己写的程序跑起来,像普通用户一样点一遍,看看结果对不对。 这是她吃过亏之后得出的结论。今年 4 月她在 Cursor 解决一个窗口卡顿的问题,一开始全靠手工:她自己去看各种性能数据,再把看到的转述给 AI,AI 改完她再去看。她形容自己成了 AI 和检测工具之间的“人肉中转站”。她在 Cursor 写的第一个技能就是验证。在这之前,AI 看不到自己改动的效果,只能等她来回传话;有了验证,AI 可以自己改、自己看结果、不满意再改,一轮一轮往下做,不需要她守着。现在她所在的团队里每个产品都配有这样的验证技能,全团队都在用。 做这个技能时她还总结出一条原则:工作里有的部分需要动脑判断,有的部分只是照章办事,照章办事的部分应该写成固定的程序,只把需要判断的留给 AI。起因是她发现,每个 AI 在检查前都要自己从头写一遍检查用的小程序,各写各的,有的能用有的不能用,用完就扔,又慢又浪费。她把这部分做成一个现成的工具,所有 AI 直接调用。 二、AI 反复犯的错,去改规矩,不去改 AI Lauren 不喜欢“软件工厂”这个流行说法,她更愿意把自己的工作比作经营一家米其林餐厅的后厨。主厨不用亲手做每道菜,但要安排好整个厨房:食材什么时候进、怎么存,每个人用什么工具,菜按什么流程出。工程师现在也一样,不再亲手写代码,却仍然要对结果负责。她认为工程师现在最重要的工作就是把这个“厨房”布置好。没花时间布置的人,信不过 AI 的产出,只能盯着它一步步干,忙到没空改进工具,就像一直拿钝刀切菜。 她举了自己的例子。Grok Bot 最早几版的代码挤在八个巨大的文件里,每个至少一万行,AI 加新功能时就接着往里塞,越塞越乱。她后来定了规矩:每个功能必须放在自己单独的文件夹里,做一件事只允许一种写法,不合规矩的代码会被自动检查拦下来。这样 AI 加功能时不用多想,按规矩放就行。她的习惯是一直观察 AI 在哪里出错,每看到一次就问自己:能不能加一条规矩,让这种错以后根本写不出来。 不逐个检查,靠的也是这套办法。她说,开了几家餐厅的老板不可能尝每一道菜,只能抽查。她每天挑一些改动仔…

【Chatgpt 如何工作,解密内部工作原理】 你给出一个提示。💬 它在几秒内回复。⏱️ 但没人告诉你的部分... 😮 它不像你那样理解。🧠 它不像人类那样被训练。👶 它只是...在预测? 🤖 这里是ChatGPT如何工作以及为什么令人毛骨悚然地有效的真相!👀👇 🎯 Step 1:你输入一个提示。 🎯 Step 2:ChatGPT将你的输入拆分成更小的片段,称为“令牌”。 🎯 Step 3:它将这些令牌转换成数字(向量),这样计算机就能理解它们。 🎯 Step 4:ChatGPT使用“位置编码”检查每个令牌在你的消息中出现的位置。 🎯 Step 5:它使用强大的“transformer”神经网络一次分析所有令牌,而不是一个接一个。 🎯 Step 6:模型使用“注意力机制”特别关注你的输入中最重要单词。 🎯 Step 7:所有这些信息通过多个transformer层来理解更深层的含义。 🎯 Step 8:模型回忆从其训练数据的数百万个示例中学到的模式和知识。 🎯 Step 9:它预测下一个单