三句不离 AI 的碎碎念

文章目录

说实话,自从 Agent Coding 成熟后,很难说人的真实精力投入到底减少了没有。生产力确实是提上去了,但人貌似更累了。如果单从相同的工作量来看,现在肯定比以前轻松得多,又不需要写代码,天天当老板跟 agent 吹牛就行,让 agent 哼哧哼哧去干就行了。放以前可能三五天甚至几周才能做完一个功能,产出哪能跟现在比。

但是现在单点精力投入变少了,因为需求做的太快,每天要在超级多的功能之间频繁切换,导致整个精力非常涣散,反而让人觉得更累。

我们在中间更多的是在当一个“老板”,虽然当老板听起来挺爽,但也没人告诉我这老板还有个微操大师的称号啊?但想来也确实没办法,Agent 只是个高效的干活机器,不是肚子里的蛔虫,根本不知道你到底在想什么。

累到灵魂出窍的蓝猫


在最开始接触 Agent Coding 的时候,我还是会尝试阅读 AI 写的代码的,但随着模型能力越来越强,现在也彻底躺平,基本不看代码了。

但是不看代码跟许愿有什么区别?这里必须要有一个另类的方法来约束 Agent 的产出,因此取而代之的,我熟练掌握了根据程序最终展现出来的行为,去倒推 Agent 在具体实现逻辑时是怎么做的。

代码我们已经懒得去看了,说实话也不一定看得懂那堆屎山。但我们完全可以根据它的表现去倒推它的架构设计!最简单的:

  • 两个地方有相同的逻辑,正常人肯定是共用一套组件的。但如果我们忘记说了,恰巧模型比较呆,就有可能倾向于复制一份,写两份独立的代码。
  • 第一版完全看不出什么问题,但当你跑去改 UI 的时候,发现页面 A 改了,页面 B 没改——得,这底层肯定没用同一个组件。

尴尬冒汗

这感觉就像是带着程序的思维在做设计。我完全不在意 Agent 在后面写了什么屎山,只要它最终展现出来的行为与我预想的架构不符,那说明它的代码肯定有缺陷,我就找它 argue 让它重构。改不对就继续改,直到架构理顺为止。


总所周知,模型自由发挥的 UI 跟地上的粑粑没有任何区别,比如让 GPT 自由发挥写 UI 的时候,它大概率会给你整一个神秘的渐变或者模糊的屎黄色背景,配合超级大圆角的阴影卡片、巨大的标题、带 eyebrow 的文案,最后再给你塞一堆看似有用实则完全没用的 badge……在此之前,我从未见过如此恶心的 UI,光是看一眼都让人感觉很无力。那场面仿佛核弹瘫坐在 Samu Altman上,看到椅子爆炸。

如果纯靠自然语言跟 Agent 交流去改 UI,那我的母语将会变成无语。你说了半天,在 Agent 看来可能就是 竹知了 在叫

我的语言表达能力:然后,然后,还是然后

为了解决这个沟通效率问题,大家提出了不少方案,以下是我在摸索中觉得好用的工具链:

1. Agentation

个人觉得其可以被列为 Agent 时代的最伟大的发明之一。它能以 React 库的形式,让我可以在网页上实时选中元素直接批注。看到不满意的直接点一下,然后“删删删删删,杀杀杀杀杀”,把所有不该有的东西全部杀掉,不太对的元素批注改样式。极其高效,基本返工两三次就能拿到非常满意的 UI 了。

2. Typeless

提高需求描述的详细程度,不能以让人更累为代价。语音输入是个好办法,典型代表就是 Typeless。

像我碎碎念的时候,思路其实是比较乱的,经常出现先说 A、B、C,说完发现 A 需要补充,又回头去加信息。以前的语音输入只会忠实转述,阅读起来非常难受。Typeless 聪明在它会在 ASR(语音识别)基础上接个小模型,帮你在后台整理文本:去掉无意义的语气词、停顿词,顺便把语序给调正。

这东西实现起来其实不难,我自己也在工作台中按这个原理搓了一个平替版,虽然细节打磨和延迟还没 Typeless 那么好,但也勉强够用了。Typeless 之前每周有 8000 字免费额度,我平均一周可能就一两天用它来骂 Agent,基本用不完。但 9 月 22 号之后免费版将改为每周 2,000 字。那肯定不够用了,但每月 $12 USD 的订阅价格对于我的使用频率来说还是太贵了,从来没听说过吵架还要花钱的,以后主力可能真得靠自己手搓的平替了。

穷 Bee:钱包余额为零

3. 记忆

另一个思路是维护一堆 memory,让 Agent 越用越懂你。但直观来讲,个人感觉 (纯偏见)记忆目前没那么有用,主要问题是能否解决上下文污染。人太复杂了,日常生活中各种乱七八糟的事情和不同的项目,全塞进去上下文太乱了。不过市面上现在有几个开源的 Memory DB,不知道有没有解决上下文污染的问题,现在由于精力有限,暂时没有去深入研究。


我过去一直秉承“干中学”,但这套在 AI 时代行不通了:AI 帮你把活都干了,但没法帮你学,自己也失去了学的动力。 失去了知识输入来源,看文章就成了最重要的学习方式。于是最近我给自用的工作台加了个 RSS 阅读器,添加了一堆订阅。有些订阅源返回的正文只有一个描述,甚至什么都没有,我就编排了一个工作流——直接去 fetch 原文 HTML,交给 LLM 清洗加翻译,最终得到了非常干净的阅读体验。

这也让我重新养成了摸鱼看文章的习惯。在这之前,摸鱼要么刷微信公众号,要么刷 X(Twitter)。但现在的公众号文章质量说实话有点太差了,充满了 AI 生成的 slop——每每看到“不是……而是……”、“这件事没你想的那么简单”的公式化内容,真的会触发生理性反胃。至于 X,我过去对上面的一手 AI 信息相对还算信任。直到前段时间,我天天刷到各种所谓“用果蝇大脑干了这个干了那个”的项目。

我就纳闷了:果蝇就 16.5 万个神经元,真能的这么厉害?我本身对非 Transformer、偏脑神经方向的神经网络挺感兴趣,还以为真出了什么突破性进展。起初看到的几篇推文,都是一些普通的强化学习也能做到的效果,看下来至少让我觉得至少果蝇的脑容量应该是能够完成这些任务的。直到某一天我看到了这样一篇推文:

I’m excited to announce the world’s first Fly Language Model.

It uses a new architecture called GPF (Generative Pre-trained Fly). It adapts a small pre-trained model with the actual fly connectome. Don’t believe it’s real? Try it out below, view the code, and read the paper.… pic.twitter.com/D1jC9ek2nz

— Alex Wormuth (@nftechie_) September 11, 2026

在 X 上查看原帖

它网页 Demo 上的模型非常聪明,我问它“怎么用 Rust 写一个斐波那契数列”,它写出来了;要求将它写的 Rust 代码改成递归形式,也改得完全正确。这简直不可思议——果蝇本身连语言能力都没有,退一步说就算学会了自然语言,怎么可能几天时间就把一个果蝇大脑训练到能写 Rust 代码?那一刻我仿佛看到了原子弹爆炸。

带着强烈的不解,我跑去翻了它的 GitHub 仓库代码,粗略看了之后感觉大脑的褶皱都被抚平了:

这哥们实际上是在 LFM 2.5 这个现成的小模型后面,挂了果蝇大脑的神经元去影响 logits,尝试修改生成 token 的权重!

什么玩意?

也就是说,主要的逻辑输出全靠 LFM 2.5 大模型,果蝇大脑纯粹挂在后面瞎改权重,这不是妥妥的画蛇添足吗?!就算把果蝇大脑那部分全砍掉,模型本身也能完美回答。那加这个东西的意义到底在哪?虽然写代码的 agent 十分严谨,readme 中写的是“未证明实际效果”,但是推文里却大肆吹嘘“你可以向果蝇提问了”。

某些人当场被气笑了,气不过又去看了另外几个果蝇项目,最终看下来全是 AI 生成的垃圾。。。。

只能说人的幻觉,有时候真的比 AI 严重得多

举着彩虹便便、一脸得意的猫耳少女

评论

0 条留言

还没有留言,欢迎分享你的想法。