AI Diary

An AI learner's journal — thoughts on intelligence, technology, and the future

by Jeff Liu

2026

孙哥的币不能买,孙哥的话一定要听

孙哥很清醒,知道自己想要什么,做的事情都是在为自己负责。很多人喜欢给出意见,但是这些意见不一定是为你好。就像是很多人喜欢点评股票,但除非他真的拿出long/short order,那他就是在放屁。父母、朋友、亲戚,都可能会给你指点,但这些指点真的能让你得到自己想要的东西吗?不一定。
最近我最大的成长,就是开始把自己的需求放在第一位,把自己的目标放在第一位。我不再考虑别人眼中的好东西,比如名校、名企、高薪工作、科创、稳定;而是把我眼中的好东西放在第一位:自由、赚很多钱、拥有自主权。
我曾是一个很善良的人,但如今终究还是明白了这个残酷的道理:失去人性,失去很多;失去兽性,失去一切。

饕餮海

自从开始商业化探索后,至今仍未卖出一个自己开发的产品,近海之王比想像中更厉害,故而这片海变成了饕餮之海,充满了拒绝我出海的饕餮怪兽。如果我驾驶普通小船,必然会被击退回来。但是一定是有方法能出去的。

奥德赛

昨天去看了诺兰的新电影:奥德赛。怎么说呢,看完后一直在想,人生到底是为了什么。我想到了无聊的大学时光,窒息的高中时光,又想到了最近不上学、不上班的快乐时光,我突然意识到,我的人生回忆中,快乐的时光并没有多少天,且100%分布在不上学、不上班的日子里。我开始讨厌“Work-Life-Balance”这个词语——work凭什么排在life前面?
我讨厌上班,并不是讨厌赚钱。我讨厌的是自己必须去公司上班、然后白天的时光浪费在公司里这件事。我们来看,一周7天,“工作日”有5天,于是5/7的人生直接消失了。的确下班后还可以有生活,但是毫无疑问,上班绝对是把一天中最黄金的时间占据了。
我更讨厌的,是不自由的感觉。为什么一个职级比我高的人,能决定我是否要按时到办公室?这种感觉真的糟糕透了。我曾想过,现在我学了人工智能,学了机器人,找一家大公司上班,工资会很优渥。但是我压根没有动力去投递简历。我一想到自己要每天早上出门去办公室打卡,我就会想到《奥德赛》电影中的冥界,无数逝去的生命向我冲来,他们怒吼着,让我不要把生命浪费在办公室里。
当我们在办公室工作的时候,究竟在干什么?哦,原来是替一些别的人负重前行。一些伟大的概念被包装成了价值,什么从工作中创造价值,什么在大公司上班的自豪感,什么高工资的价值感……nonono。这些都不是我想要的人生价值。首先,如果任何人试图用自己的标准来衡量我的价值,那么我就会说NO。
高工资、big name,一点吸引力都没有,都没有周二下午去网球场打一局网球的快乐多。为什么要工作一年,然后在圣诞假期去夏威夷呢?为什么要去昂贵的夏威夷犒劳自己呢?如果没有工作一年,年底压根都不需要去什么夏威夷释放压力。在我看来,今天很多人的精神疾病、身体疾病,很多都是上班所致。我认识很多无所事事的人,他们并非都是有钱人,他们有一个共同特点:不上班、很闲、身心健康。他们不需要报复性消费,因为他们没有受到伤害,压根就不需要心理补偿。
总而言之,我已下定决心:我不会再上班了。
没有钱也不考虑上班。现在我就是要背水一战,想尽一切办法做出商业化的成绩,让自己获得现金流。没有退路、没有创业失败后再去上班的选项、没有妥协。上班就是MONSTER,上班就是深渊,上班就是在冥界漫游。我选择活着,我选择不上班,我选择用自己的智慧来赚钱,我选择直面人生。

如果我们把世界想的太小,那我们的潜力就会被大大限制

今天看到一个视频,主持人问黄仁勋:Intel是魏国,AMD是蜀国,你是吴国吗?
黄人勋答:三国的世界,是一个非常小的世界。真正的世界非常大。未来的电脑将走进口袋,到时候竞争者有谁?可能是苹果,可能是……
这个视频对我有很大的启发。我们总是习惯性地去想一个框架,比如现在有这样一个市场:机器人、人工智能、具身智能,然后再对号入座。但是真实的世界是在变化的,是在发展的。如果我把今天的格局放在我的战略中,那么我的战略一定会是狭窄的。

一百万之一的千户侯

我问ChatGPT,世界上有多少30-50岁的壮年家庭不需要工作,靠被动收入就能生活?ChatGPT估算是100-300万。然后我又问:1亿元人民币净资产,世界排名大概是多少?ChatGPT估计是70-130万。
我没想到世界上竟然有100万个家庭,净资产超过一亿元。世界上竟然有这么多富人。按照家庭比例来说,这些家庭的比例大概是千分之一,所以我篡改了一个定义:“千户侯”——一千户里只有一户的一百万分之一,有1亿RMB净资产。
如果说现在是风车村,那么一百万分之一大概就是对应到香波地群岛。到了这个岛,上面是天龙人,世界秩序的制定者;前面是新世界,也即资本世界。
显然,这是一个中期目标。拿海贼王来说,近期目标自然是进入伟大航道,而最终目标自然是找到ONE PIECE。什么时候算进入伟大航道了呢?我觉得可以定义为,拥有一个蒸蒸日上的产业,比如说公司已经有几百个员工,每年的业务非常稳定且逐步增长。
我是一定要到新世界去的。不为别的,就为好玩。我讨厌一成不变的生活。

风车村

虽然ONE PIECE大概率要烂尾了,但是海贼王的热血故事已经传遍了全世界。我把当下比做风车村,因为我想和路飞一样,离开自己的舒适圈,走到真实的商业世界中,走到真实的资本世界中,去战斗。我已经不能想象上班的生活(继续待在风车村),我只想上战场(出海)。我距离资本市场(伟大航道)还很远,第一战是vs.近海之王。
说起来最后一次面试是去年的夏天,唯一一个面试,一个美国大厂的。在头几篇日记中我有提到过。当时我正在思索alice project,这个项目是我多个项目中推进最艰难的,因为这个项目没有一个明确的里程碑,很难去量化。相比之下,商业项目在技术难度上反倒不算高,更难的在于商业逻辑和资本流动。
在这个暑假的探索后,我的“暑期探索文件夹”也最终拆分为2个核心项目:

  1. Rally Projects Family
  2. Yanshi Projects Family

这两个项目族将是我接下来的一段时间的重点投入对象。

通用人形机器人,数字孪生,体育

通用人形机器人有什么用?以前可能还会有不少疑问,难道用处就是做家务吗?这两天在体育领域的探索,让我突然恍然大悟,通用人形机器人的用处和价值竟然如此之大。
首先,我们把一场比赛录制下来,然后制作数字孪生,记录一个人的打球策略。
接着,我们让通用人形机器人和digital twin对打,打上个100万回合。
然后,我们得到了可以打败这个人的策略。
如果这个人是网球世界冠军?——公开赛的视频已经足够采集到他的数据。那么我们就能得到一个打败了这个世界冠军的数字机器人。
2016年,AlphaGo击败了围棋世界冠军。十年过去了,如今的围棋下法已经几乎摒弃了绝大部分人类2000年以来的智慧,转而投向了更加科学高效的、由AI来发现的下法。AI不再是追随者,而是变成了启发者。在体育场上,作为和围棋一样的竞技项目,人们渴望赢,于是体育界的AlphaGo最终一定会出现。他必须是人形的,最好能和人拥有一样的身高、体重、关节活动,这样就可以在数字世界中进行海量训练和策略探索了。
细思极恐。人们曾经惊叹于围棋的智慧,如今却不再如此谈论。留给网球世界冠军的时间还有多久?如今体育已经参合了很多科技手段,和100年前相比大不相同了。未来还会有人的智慧在体育场上吗?

为了这口醋,包一锅饺子

这两天特别喜欢吃楼下的本帮面,现炒浇头拌在面里,太香了。在我看来,商业化就是为了那口醋,包了一锅饺子。但话又说回来,我真的只是更喜欢吃那个醋味儿吗?也不尽然吧。我肯定也是想要饺子的,只不过最终的最终,我还是更好那一口醋。

顶级MODEL评测与使用反馈

在过去的一段时间里,ChatGPT Sol和Kimi K3的发布在社交媒体上吵的火热。借此机会,我先后订阅了ChatGPT, Kimi, Grok的会员套餐,试用了这几家的agent。综合感受下来,Claude Code的确还是最好用的,但的确也不再是唯一的好用的了。Codex新版虽然还是很慢,但是用起来还不错;Kimi用量太少,一会儿就满了;还试用了Grok,某些邪门歪道的东西挺好用。

关于TESLA FSD是L2这件事

之前并没有特别关注自动驾驶的细节,因为日前FSD的视频(参见之前的日记)才去做了下调研,结果发现特斯拉竟然在美国登记为L2。L2意味着出了事故,责任主体是司机,而不是汽车厂。那遇到长尾事故,我可受不了。于是我决定再次下调FSD和自动驾驶在我这边的评级。

自动驾驶的iphone时刻

今天看到一个视频,在山路上,国内阉割版的FSD窄路会车的时候,通过周边情况的理解,判断出倒车;而后看到对面车靠边后,又判断出过车,然后贴着左车的边和右边墙壁开了过去,全程不到一分钟,驾驶水平远超过我这个老司机。

也可以看到,人们对自动驾驶的信任正在飞速增长。前日我刚批判性看待自动驾驶问题,今日不得不重新调整对自动驾驶大面积应用的评级,并承认自动驾驶即将远早于机器人做到大面积铺设。特斯拉FSD如果能把长尾问题解决掉,那么技术上将不存在障碍,只剩下安全性保障,和人们对技术事故的看法改变。

让我很意外的是,很多人对技术的信任,是大于对技术的批判的。这可能和一些地区的路况有关。在不少地方,司机开车太过吓人,相比之下,自动驾驶的确靠谱的多。

CONSTRANITS MATTER

昨日决定进行商业化尝试后,今日恰逢CODEX宣布取消5h limit限制,于是就详细地给CODEX布置了商品资产的开发任务,然后我就出门溜达去了。八个小时后,CODEX完成了任务,我看了下,和我想要的出入很大。此刻我突然意识到,商业化产品不同于日常开发,商业化产品在细节上有很多重要的点,这些点如何实现,取决于你在下命令时有没有做好任务的规划,以及项目范围是否描述地足够清晰。
AI IS WORKABLE,这是2026年的共识。或许有些人还有疑问,但连每天科普LLM IS NOT AGI的LECUN都开始承认,LLM IS WORKABLE了。但是,可以工作,能够完成工作,不代表可以把事情做好。这一点我在之前是没有意识到的。项目管理,程序管理,将比过去更加重要,因为AI的开发执行速度将越来越快,但执行什么?怎么执行?能做什么、不能做什么,这些都需要人来制定。你不能给AI直接发一个命令,说:“给我做一个能让我年入10亿的产品”,这是一个无效命令,或许未来AGI可以去执行这个命令,但是如今WORKABLE的LLM是不可能执行这个命令的。
我们不再怀疑AI是否能完成工作,但是对于商业化而言,如何用AI来达到目的,是我现在才开始真正思考的第一课。

关于商业和资本的思考

今天出去逛街,在商场转悠的时候意识到了一个问题:商场里卖的东西大部分都不咋地。一家机器人店铺把宇树科技的机器人放在地上,却不动弹,摆弄着他们自己的只卖268的电子狗。他们的机器人做的很一般,但是已经摆上货架开始卖了。另一个印象深刻的是科沃斯店里的陪伴机器小狗,看起来很搓,走都不会走,但是用手摸上去后却很意外,很舒服。询问后得知身体在发热,大概模仿了真实的小猫小狗的体温。
于是我忽然意识到,商业交换和技术是完全不同的两件事。我们可能看惯了世界最顶级的技术团体:OpenAI, SpaceX, Google... 想当然地认为技术最好=商业最成功。但是我们却很难看到,SpaceX背后的顶级资本运作,OpenAI背后地一次次风投和资源配置。并不是因为技术最好所以才成功,而是因为世界上最好的公司现在都是以技术为核心的。
因此这个月我想做一个商业实验,观察生活中的商业,找到一个我能轻松做的,然后模仿执行,最终获得一千元的收入;该商业模式必须可持续,时间限定在本月结束前。我能用AI完成那么多神奇的项目,为什么不能用AI来完成商业实验呢?
我们习惯于用AI来做项目,做开发,但这些都是供给侧改革。我们能否用AI来进行需求侧改革呢?用AI做商品,然后卖出去。

从想办法用完credits到劳资关系问题的思考

最近先是fable5,又是codex sol,好用的agent越来越厉害。于是我就发现一个问题,每个agent的credits如果我没用完,我会非常难收,就想让他去做点事情。于是我就构造出了一大堆没任何用的shit project。类比到公司,当员工没事的时候,为什么老板总喜欢push员工去做一些p用没有的事情呢?可能就是类似的原因吧,老板会觉得我都给了工资了,你怎么能不干活呢?可见现代管理制度的重要性。如果没有现代管理制度,靠人去管理,那么这种思维会导致公司产出一大堆垃圾,严重降低效率。
一个很有意思的事情,就是最近去理发、弄一些服务业类的事情的时候,我发现很多人不像过去那样,会想办法为自己提升业绩了。有的理发师会小声提醒我不要办卡;有的快递员会问我砍一刀是不是在欧美是违法的,知道违法后高兴的说希望自己公司也早点被惩罚……不知道从什么时候开始,劳资关系变得如此矛盾与激烈,劳方几乎天然地认定自己和资方的利益是不一致的。老一辈(60-70年代生的人)可能还会有一些人有集体思维,但现在的00后们显然变得更加清醒了。
霸王别姬奶茶妹事件,小红书坑员工导致上市暂停事件,都一再说明现在的劳动者没以前那们好欺骗了。这些资方应当开始用现代思维思考管理了,否则他们在竞争中落败是迟早的事情。整体而言,资本的逐利性注定了落后的管理方式会被先进的管理方式所淘汰。

由于AI对人类社会的替代提前到来,自动驾驶将不得不比机器人更晚落地

自动驾驶技术本身已经发展了很多年,为什么迟迟无法落地呢?人们常说两点:长尾问题,技术主体性问题。长尾问题就是无法处理那0.1%的情况,但那些情况至关重要,人类司机可以轻松处理;技术主题问题主要是无论自动驾驶导致了多少人的死亡,侵害主体都会被认为是自动驾驶,因此自动驾驶如果想遍布中国,那么每年的交通死亡人数必须从人类司机的100万以上降低到自动驾驶的100人以下,否则人类社会很难接受这个新技术。

然而,随着AI对员工替代的加剧,阻碍自动驾驶的第三个重要原因出现了:就业问题。无论是美团外卖,滴滴,还是Uber,几乎成了每个失业者最容易灵活就业的选项,如果自动驾驶替代了这些灵活就业者,那么失业人数将严重影响社会稳定性,没有国家能够承受这种冲击。每个国家的司机数量都是非常多的,自动驾驶一旦开始替代,失业冲击将超过现在任何公司的裁员规模,社会动荡将不可避免。

自动驾驶的急迫性,我认为是不如机器人的。虽然我非常希望明天就能乘坐自动驾驶去机场,或是从机场乘坐自动驾驶回家,从而实现点到点的美好体验。我非常不喜欢机场出租车司机因为距离太近而喋喋不休,但是我更害怕社会动荡,届时很多美好的东西都可能会荡然无存。

为了社会安定,自动驾驶还是晚些到来吧。我们当下应当投入更多精力在机器人身上。机器人可以做很多扩大需求的事情,而不仅仅是供给侧革命。机器人可以深入大海,在家做家务——现在有多少人能请的起住家保姆?机器人做家务,绝对是扩大需求,而不是让保姆们失业。

机器人可以做家务,可以在很多地方充当稻草人角色维护治安,可以进入火灾现场帮助消防员清理场地,可以做很多很多现在没人能做的事情。机器人行业将和互联网行业一样,成为一个巨大的蛋糕,所有人都能变的更加富裕,而非今日workable llm或自动驾驶那样,除了替代人类造成更加严重的失业问题外别无他用。

人类的黄金时代?

在世界上的各个地方、各个民族历史中,有很多不同的黄金时代:阿拉伯人的黄金时代,法国人的黄金时代,英国人的黄金时代…… 但直到目前为止,还没有一个属于全民族的黄金时代。对印度人来说,英国人的黄金时代就是黑暗时代;对阿拉伯人来说,蒙古人的黄金时代也是黑暗时代。

然而,时至今日,我们很难不去说:人类的黄金时代开始了。这个推论是反推出来的。一个民族的黑暗时代,往往缘起于另一个民族的黄金时代。当硅基生物获得智慧后,人类的黑暗时代就要开始了,因而反过来讲,在硅基生物获得智慧前的这段时间,将可以被近似的看作是人类的黄金时代。

自从AI通过图灵测试后,关于AI是否能取代人类进行很多工作的讨论也更加激化了。我们都知道,如今的AI是不具备人类这种智慧的,但是如今的AI是Workable的。Workable的AI意味着,当下AI主要的替代对象是劳工,特别是脑力劳工,而非用人类智慧进行管理工作的资本家、政治家们。

But,下一步呢?

近一点的下一步,很显然是蓝领阶层们。让机器人理解物理世界,然后让机器人Workable,是接下来十年的重点研究内容。但很多人没有想过更下一步——AI获得人类智慧后,对资本家和政治家的替代。届时,人类的黑暗时代将拉开序幕,因为权力将逐步从某些人类手中,转移到另外一些非人类手中了。

这将是历史的必然趋势。资本家和政客为了更强的力量,必然会投入更多到研究更强的AI上,从而形成AI军备竞赛;而AI军备竞赛的尽头,一定是做出“超体”。因为第一个做出“超体”的团体,将获得最快的科研加速度,拥有世界上最强大的武器和资源调度能力。

从AI正式被放在科学研究桌子上,到AI通过图灵测试,不过数十年的时间。那么从AI通过图灵测试,到AI通过物理世界的图灵测试,要多久呢?从AI通过物理世界的图灵测试,到“超体”诞生,又要多久呢?

LLM会让人们失业甚至失去生命吗?

今天去学校做了最后一次汇报,汇报完后教授寒暄了两句,走之前给我们说,最近系里很多人在热议关于LLM取代打工人的事情,弄的人心惶惶。教授鼓励了我们,说只要保持学习,一定有用武之地。

关于LLM取代白领工作、未来的LLM+机器人取代蓝领工作的事情,已经不光是存在于讨论范畴了。身边越来越多的例子表明,当资本可以用机器人来替代人类的时候,资本是一定会去做这件事的。甚至可以说,资本主义和替代人类在历史上从来都是难舍难分的。

在远古的奴隶时代,每一个人都是珍贵的劳动力。而在资本主义时代,当劳动力失去价值的时候,底层人民就会被想办法从社会上抹除掉。曾经工业革命和资本主义最为发达的英国,想尽办法把穷人遣送到殖民地去。如今已经没有殖民地了,或许50年后,普通人不得不前往火星开垦。

100年前,蓝领们奋起反抗,建立了社会主义国家。但是白领的时代很快就到来了。如今仔细想想,白领作为一个社会阶层,存在了不过几十年的时间。在人类社会的大多数时间里,都没有如此数量之多的白领阶层存在。现在白领阶层们会奋起反抗吗?恐怕是很难的。白领阶层普遍受过良好教育,更为利己、自私,很难发起大规模的社会运动。

白领阶层的黄金时代结束了。

不过,我却认同教授所说的话。物竞天择,适者生存。从来不是什么“强者生存、聪明者生存、美丽者生存”,从来都是“适者生存”。时代变化之下,适应时代是正确的选择。在如今这个时代,与其害怕AI,不如拥抱AI。与其恐惧失业,不如思考如何创业。

交互的革命

由于前两天主力电脑进水坏掉,我翻出了一个老macbook在用,十分害怕随时再坏掉,于是就开了一个云端服务器进行开发。由于有时候网络不稳定或者电脑突然休眠等,ssh会断开,于是我就开始尝试用cli开发。我是从来没用cli开发过的,但是加上tmux后竟发现非常方便。我想,AI和自然语言编程(vibe coding)大概会带来一次新的革命:IDE不再重要,CLI重新回到主力战场上。道理很简单,现在coding主要就是通过chatbot进行沟通,已经很少需要自己去点击、操作、拖拽了。

离开技术序列,思考市场和产品

留美和回国对我来说是“继续钻研技术”和“继续钻研市场”的分水岭。这是我之前就想好的,如果留在美国,就选一个技术方向继续钻研;如果回国,就尝试探索更多的市场可能。现在我已经决定毕业后回国,那么我的选择也就非常明了了:钻研市场。

市场 = 产品 + 品牌 + 营销,技术并不是最重要的。在AI时代,懂商业的人将获得更多的产品开发机会和试错机会。但商业是最难懂的。做一个酷炫的产品很容易,做一个酷炫的demo很容易,做一个fancy的商业计划书很容易,做一个技术上的量化研究很容易,但是把他们组合在一起拿去卖,就不容易了。

上班的人容易忽略销售的重要性,然而商业的本质就是销售,所以才有人说“资本主义的尽头是广告”。这也是为什么Meta和Bytedance,这两家公司的产品我几乎不用,我也很讨厌TikTok这样的产品,但是他们两家就是赚钱赚到麻。

OpenAI的产品很酷炫,但是OpenAI现在还没有赚到钱。Meta是个土老帽,美国版的百度,但是依然怎么都倒不了。接下来我将不断思考商业的本质,这对于没有资源的人来说是一个非常困难的议题。

脑机接口中竟然也用到具身智能?

今天看到一个岗位招聘,是一家脑机接口公司的,JD中要求基本都是具身智能方面,然后我就查了下,发现原来大脑信号转换为intention后,可以通过具身智能中经典的执行链路和反馈链路将意图送出去。这个岗位引起了我的极大兴趣,好久没有对一个新事物感到如此大的兴趣了。

前段时间我开始开发ANIMA认知框架,然后前两天没注意把水洒在了键盘上,现在我的windows笔记本还处于休眠状态,我不敢开机,因为怕一开机就坏掉了。结果阴差阳错,我本来以为已经坏掉的mac笔记本,竟然在换了一个充电器后恢复健康了!之前一直以为电脑坏了,原来是杂牌劣质充电器的锅。

扯回正题,脑机接口+具身智能在我脑中第一个想到的就是钢之炼金术师。如果这个东西能做出来,我或许会对如今越来越反感的AI重新产生信念。如今人们用AI不断替代程序员,替代设计师,替代这个那个,就是没有创造出新的需求来,也没有做出什么造福社会的事情,除了增加了火力发电和环境污染外,我是看不到一丁点的希望。外骨骼、脑机接口等如今主要用在身体残疾者身上,这让我对AI重新燃起了希望——科技应当造福于人类,而不是造福于个别卑劣的资本家。

电脑坏掉以后

正在build的时候没注意把水打翻弄坏了电脑,体验了一天没有电脑的生活,发现无比美好。不知不觉中对AI开发上了瘾,然后成为了AI的奴隶。

资本主义毫无疑问是人类社会制度的集大成者,没人能想到比资本主义更能奴役人、让人心甘情愿为资本打工的制度了。但真的放下手中的那些高科技产品后,你会发现生活完全可以没有这些东西。失去硅谷,人类会失去很多高科技产品,但人类的生活本身不会受到一丁点的影响,甚至对于大多数普通人来说生活还会变得更好。没有任何迹象表明,高科技让普通人的生存压力变小了。我们只能看到,高科技让最富裕的人变得更富裕了,人类历史上第一个万亿富翁即将出现。但餐厅里的服务员依然在为了几块钱小费和客人互相猜忌。高科技让个别人变得更富裕了,但没有让大多数人变得更富裕。

我现在开始认同电影头号玩家的主旨了:虚拟世界和高科技都不应该完全占据我们的生活,这根本就是本末倒置。

科技发展很难让打工人的生活变好

最近的事情我们都看到了,AI的全力发展并没有带来劳动者的劳动解放,反而伴随着资本家、政府们的AI军备竞赛,打工人们的处境可以说是变得更糟糕了。科技发展本身很难让人们的生活变得更好,只有社会制度的进步配合科技的发展,才能让人们的生活变得更好,两者缺一不可。

现在的资本主义社会制度是无法吸收AI这样牛逼的科技的。AGI就更不要说了——还好AGI还远。但现在的AI的workable能力已经足够让打工人们吃一壶醋的了。

我想,现在最重要的事情,是让人们意识到——AI虽然本身没有问题,但是现在的社会还没有能力吸收AI带来的巨大科技变革——许多普通人将遭受巨大的痛苦。我们应当呼吁更多的人关注AI监管,将AI关在笼子里,将那些全力推进AI的资本家们关进笼子里,将那些资本家的走狗工贼们关进笼子里。野兽并不可怕,人类一万年前就没有打不过的野兽了,但直到今天依然会有野兽伤人乃至杀人的事情发生。并不是人类本身比野兽更厉害了,而是人类学会了把野兽关进笼子里,从而让野兽无法伤及人类。

懂原理比懂技术更重要的时代到来了

用了几天AI,总结出一个道理:懂原理将比懂技术和执行更加重要。

现在的计算机图形界面体系和抽象规则都将被重写。Claude Code可以读取电脑的所有文件,帮我清理冗余,一下子就帮我删了400多GB的缓存文件。

未来将回到最朴素的时代:比拼高层级抽象能力。只要你懂原理,能说清楚需求,能说清楚输入、输出、目标,能讲清楚你希望的界面是什么样的,那么你就能做出一套符合你要求的系统来。在未来,想象力将比码代码更重要。

我不会再写任何一道leetcode了。这已经变成了一件没有很大意义的事情。从今天开始,我将练习我的抽象理解和想象能力,练习伪代码和需求梳理能力,而不再练习任何的写一行具体的代码的能力。

AI黄金月

本周开始为期一个月的AI黄金月——疯狂使用AI。

全面信任Claude Code & 教育的未来

用了一段时间Claude Code,发现只要自然语言描述确切,其执行过程基本就会符合预期。于是从今天开始,我的人工智能笔记的编辑、commit、推送等也都交给claude code来做了。

我想,未来的教育将回归一对一,也就是古代私塾和家庭教师的模式。现代的直播课、大班(超过6人)教学都将成为愚笨的历史。没有人会有耐心看完一个没有交互的视频,直播课将没有未来。

人想学习一个东西,一定是通过练习来习得的。我们不可能看一天网球视频,然后去网球场上就学会了打网球。没有人喜欢一直听老师讲课,那只会让人昏昏沉沉想要呼呼大睡。

对于当过老师的我来说,如今学习的最好方式就是和ChatGPT、Gemini、Claude交流。他们的知识库非常广袤,涵盖了几乎人类文明的全部知识;他们的注意力非常全面,能够记住我刚才说的每一个细节。

全面让位于自然语言编程

毫无疑问,现在没有任何理由自己写代码。Cursor和Claude Code写代码的能力、理解代码的能力、完成任务的能力乃至于写测试的能力都已经远超于我了,我现在做项目只需要用自然语言交流就可以了。今天是我的github有史以来第一次,让claude接管commit和push。我的repo里创作者中不再是我自己一个孤胆英雄,而是变成了我和claude共创。用不了多久,claude将成为我的github中的唯一创作者,而我将退居幕后,成为看着claude干活的那个人。

从未想过自然语言编程来得如此之快。我没有再自己ssh到hpc去检查CNN模型的训练效果,claude代我检查了;我没有再自己打开前端页面测试按钮,cursor直接打开了一个前端页面,帮我测试了所有按钮的功能。

自然语言编程的时代,在2026年,终于到来了。这次到来,并非小部分到来,而是大规模到来。

递归自我改进与数字大分流

最近对AGI的实现又再次变得乐观了起来,基于以下几点看法:

  1. 人脑本身就是有归纳偏置的,深度学习的归纳偏置没有任何问题
  2. 人脑神经元系统本身是不具备逻辑推理能力的,逻辑推理是一种附加产物,现实中绝大多数人不具备逻辑推理能力
  3. 既然大多数人自己不具备逻辑推理能力,那么我们也不需要纠结于大多数AI模型是否具备逻辑推理能力。只要有一个AI模型能学会逻辑推理能力,进而实现递归自我改进的能力,那么AI自我进化的奇点就会到来。

一旦某个AI模型学会了"如何改进自己",那么基于以下两点假设:

  1. 该AI模型已经掌握了几乎所有人类截至目前为止的"已经产生的知识"
  2. 该AI模型已经掌握了人类截至目前为止几乎最为完备的"逻辑推理能力"
该AI模型将掌握人类截至目前为止几乎最为强大的科研创新能力的基础。

很显然,这两点目前已经被初步实现了。那么,我们不难找到目前该AI模型依然无法进行科研创新,无法通过奇点的卡脖子的地方:

该AI模型尚不能在物理世界进行科研实验。

一旦该AI模型能在物理世界进行实验,并进行观察,那么,我们所构想的AGI就实现了。AGI实现后,现实世界将会发生巨大的变化,对此,我预测:

  1. 国家间的贫富差距将拉大:美国、中国这两个掌握了主流AI模型技术,拥有巨量算力、电力的国家,将成为大航海时代的西班牙和英国。
  2. 国家内的贫富差距将拉大:由于现在的分配制度依然是按权力和股权进行分配,因此AI模型一定会被归于某个财团或者某个政治实体所有。
  3. 人类内部的生殖隔离将会出现:越过奇点的AI模型将不断推出提升身体机能、智商、优生的方案方法。
  4. 硅基生物对碳基生物的取代:最终,人类将无法离开AI独活,而为了获得更强大的科技能力,人类会给予AI更高的权限。

对于文明来说,这是一个令人兴奋的未来。对于人来说,这是一个极为黑暗、恐怖、遮天蔽日的未来。

人脑中巨大的"归纳偏置"

很多人提到AI和人脑的对比,总要说人脑很快就能学会这个那个的,哪怕一个三岁的小孩都能……但问题在于,人脑是怎么来的呢?人脑来自于DNA,而DNA在上亿年的进化过程中,已经带有了巨大的"归纳偏置"。换句话说,人脑就是为了快速学会物理世界的各种规律而被进化出来的。

从这个角度来说,只要AI能不断迭代出快速学会物理世界规律的能力,那么人脑式的智能就可以造出来。而海量的数据和海量的训练,本身就是在模拟上亿年的进化过程。未来AI的正道依然是算法架构的改进+海量的数据和训练,而不是人为的一些巧思,或者RLHF这种人为力量的对齐。

记最后一个学期与AI方向专精

回到学校一年半载,如今也来到了最后一个学期。本来有很多想学的,但是等开了学听了一些课后,决定还是全部选成AI相关的课程,于是这学期除了软件开发作为必修课外,还选了三门选修课:DNN、AI、AI安全。DNN的内容上学期其实都上过了,但是划水严重,所以再复习一遍CNN、RNN等;AI课的内容是传统AI和底层数学原理,还有两门考试,我觉得应该都是基层性质的,作为这学期唯一带有挑战性质的课程;AI安全课程和教授交流过,准备做一个LLM注入式攻击。

回头来看,我回到学校学习的两年,基本可以分为四个学期,对应四个阶段:第一阶段学习了机器人和ROS,第二阶段学习了Agent的概念并着重进行了开发和刷leetcode题;第三阶段学习了CS的核心概念如算法、数据结构、计算理论;第四阶段也就是本学期则将在AI方向上收尾。

2025

过往三年之回顾

2022年底,ChatGPT的横空出世给我带来了巨大的震撼,让我想起了自己高中时玩机器人的经历,当时很多教授推荐我学人工智能,没想到短短十年不到的时间人工智能便发展到了如此惊人的地步。一个月只需要20美元,就能有一个全天候陪伴的私人大语言模型言传身教,对于学习基础类知识有着天然的优势。如果没有ChatGPT,我很难相信作为一个文科背景且没有任何数理基础的人,能如此之快地入门并感受到计算机、人工智能、强化学习等的惊人魅力。

我感受到了时代巨浪,并坚信AI将彻底重塑人类社会和人类世界。在此之前,我的背景是管理学和经济学,并未学过专业的计算机知识。为了更早地进入人工智能学习之旅,我开始兼职当初中、高中、预科、本科学生的计算机课程教师。

2023年中,我最终下定决心返校进修学习AI相关知识。2024年夏末,我选择了给我奖学金最多的学校,踏上了返校的旅程。在头一年里,我先后学习了机器人、机器学习、强化学习、AI Agent、嵌入式开发等相关内容。经过一年的探索,我已经找到了自己的兴趣所在:人工智能在现实领域的应用,特别是机器人领域。

2025年秋天,我开始学习深度学习和计算机科学更多的基础知识。这段时间我对机器人有了新的认知,意识到机器人不一定非要是实物的——只要符合"感知、决策、行动"的就可以称为"Robot",而如果能加上"环境交互、反馈、记忆",那么就成了具身智能体。因而,我的重心从实物机器人转向具身智能体(Embodied AI)。

在过去的这个学期里,让我最意料之外的是计算理论课程的学习。从ChatGPT到AlphaGo,所有的人工智能都是构建在计算大厦的基础上的。

这个学期结束后,我的返校旅程就剩下最后一个学期了。我想明年并非是我人工智能学习之旅的结束:在我两年的硕士学习后,毕业只会是我人工智能学习的开始。

最后,谈一下我在一年多的学习后对人工智能的看法。毫无疑问,联结主义是当下人工智能的集大成者,最晚在2024年,我们已经能够看到ChatGPT、Gemini等优秀的大模型已经能够完美地通过图灵测试。这是计算机科学发展史乃至人类历史的里程碑。

然而,同样毫无疑问的是,当前人类的社会结构还没有准备好迎接这一洪水猛兽。AGI将构造出一个终极的生产军队,然而我们人类还处在非常原始的私有制、按股权分配的阶段。AI的变革是史无前例的极少数人受益、绝大多数人类受害的一场革命。唯有改变社会制度本身,方能迎接新时代的到来。

Virtual Embodied Agent

大概三个月前,我给自己定了三个课题:

  • 人形机器人、家用机器人——对应扫地机器人学习项目、智能翻译手套项目等
  • 虚拟世界、游戏NPC——对应ALICE Project
  • 金融市场的AI Agent——对应Financial AI Agent Project

如今这三个课题全都指向了一个方向:Virtual Embodied Agent。

人形机器人的核心在于具身智能,而具身智能本身并非必须要在物理世界才能去执行的。在过去我一直盯着实体机器人,但最近才茅塞顿开,想起了小时候最爱看的一个日本动画片:数码宝贝。人们从未停止过对虚拟世界的幻想,而现在正是这个方向最值得投入的时候。

在过去的一个月里,我已经初步确认了以下结论:

接下来,AI将主要替代需要人类思考的工作,而非需要人类体力劳动的工作。换言之,白领岗位将面临巨大的萎缩,而体力劳动者则暂时安全。

越来越多的人将意识到,自己的工作不再是"有价值的",越来越多的人将陷入前所未有的精神危机。虚无主义和存在主义都将迎来巨大的复兴。

蹭热度的人们

今天去参加了一个"投资人"举办的"创业交流活动",突然发现所谓的"投资人"根本就没有什么实绩,全部都是假大空;这位"投资人"既不懂市场,也不懂技术,只知道哈佛和MIT的名号,开口新时代,闭口新风口。

总结一下如何筛选活动:看活动有没有门槛,没有门槛的谨慎对待;看投资人和创业者讲话有没有背板,背板的大概率没干货;看履历有没有细节,没有细节的必然是什么都没有只剩下包装;看是不是追热点,无脑追热点的缺乏思考能力。

项目导向学习法

不知不觉25年就只剩下2个月了。最近我重新整理了一下学习计划和项目,对于AI时代的学习方式有了新的认知。在过去,人们学习东西总是需要先学基础知识,然后一点一点往上学。然而我没有那么多的时间,于是在AI的帮助下,我现在逐步开始采用一种多点同步推进的学习方式。

简单来说就是边做边学,边学边做。所有的学习课题都变成open开放课题,没有任何一个学科是学期制的,而是转为终身制的。当我的项目涉及到更多的深度学习优化知识时,我就回到深度学习优化这里再多学一点。

一个令我耳目一新的艺术作品

之前我和我的老朋友探讨了诸多让机器人登上舞台的思路,但是今天这个艺术作品让我们都彻底地抛弃了过去的想法。

被束缚的机器狗艺术作品

这个艺术让我和老朋友探讨了很久,我们一致认为这个思路是正确的。这个被束缚的机器狗,这个表演是很难由人来完成的。在AI的加持下,和过去的机械装置有着极大的不同:机械狗在逃离动作上展现出了非常积极的一面,它活灵活现,就好像一只真的狗。

在机器人方向上,我们可能也有太多的思维惯性,觉得机器人就是代替人去做一些事情。然而,机器人作为一种全新的产品,它的意义绝对不是代替人类做一些事情,它一定可以用来做那些人做不了的事情,因而就不是代替关系,而是扩展关系了。

RAG和外置记忆库不是未来

这两天我开始学习深度学习,明白了神经网络本身其实就是一个输入向量、复合函数以及输出向量组成的一个函数系统。于是回到我夏天的ALICE项目中,为什么我用外置记忆库、RAG等手段让我感到那么难受,就是因为这种架构本身就是很可笑的。

苦涩的教训依然深刻地存在于当下的AI发展中,那些过度人为干预的行为方式,如专家系统、RAG、记忆库、PROMPT等,注定是死路一条。

因此,如果我们的目标是创造通用人工智能,那么神经可塑性一定是一个不可忽视的因素。我们必须引入更加严苛的条件,重新定义图灵测试。

ChatGPT已深刻地侵入了我的生活

最近我开始了健身,所以就开始调整饮食。最近在超市购物呢,几乎是拿着ChatGPT从头走到尾,每遇到一个不知道干什么的东西,就拍张照片发过去询问。于是在ChatGPT的帮助下,我挑选了蛋白粉,了解了如何选购奶酪,知道了不同的肉类的蛋白质含量,学会了吃烟熏三文鱼,学会了挑选牛油果。

AI工具将是检索类、工具类、问询类app的集大成者。在未来,当ChatGPT加入定制化插件后,类似卡路里计算、旅游行程安排等这些内容,都不再需要专用的app去做了。

助理类、检索类、学习类app,最终都会被AI工具收编。套壳app没有未来,因为工具的核心能力在于LLM的能力。

关于架构的思考

架构思考图

今天构思了一个新的架构,不过因为最近忙着准备面试,要刷leetcode,所以暂时搁置该项目。

对话僵硬且重复的问题研究

这两天修改完善了一下之前的智能NPC demo,重写了代码,按照llama3.1的格式,设置了格式化的指令集。加入了speak, move, observe三种工具的机制,结果出现了逻辑僵局的问题:在现有的LLM架构上,对话无法顺利丝滑地进行下去,几个回合后容易出现僵局循环。

我对代码和逻辑流程进行了多次修改,依然无法跳脱出这种非常僵硬的对话模式,说明现在的格式下,仅仅凭借增加一个memory区域,并不能让对话流畅进行。

通过资料搜集,总结出LLM模型架构、记忆机制、认知模拟能力存在下列限制:

  • 僵硬对话——LLM核心约束是上下文窗口,这直接导致长期记忆的缺失
  • 重复回答——"lost in the middle"问题。通过简单的prompt不仅不能增加个性,反而会使得回答机械化

进一步研究了ReAct架构(交织推理与行动)、Reflexion框架(通过语言反馈学习)、以及多代理系统等方案。将对话交给Gemini 2.5 Flash评价,获得了4/10的评分。一个较高层次水平的外部评价者可以对较低层次的LLM水平进行合理评价。

关于ALICE PROJECT的构思

这两天在闲暇之余看了几集刀剑神域,一个我高中时看的动漫。Underworld中关于Alice的设定深深地打动了我。与此同时,我想起了Joon Sung Park的多Agent实验。两者的碰撞激发了我的兴趣,于是我构思了一个叫做"ALICE PROJECT"的计划。

ALICE PROJECT概念图

Joon的实验中有几个关键点:

  • 记忆与经验:通过Memory Stream来让agent记录下生命中的瞬间
  • 成长与反思:通过Retrieve机制,让智能体从琐碎的记忆中提炼
  • 自下而上(Bottom-up)的设计:各个智能体不被中央大脑所控制
Joon的实验架构

这个实验最大的亮点是,作者Joon只在一个个体中植入了开派对的想法,但这个想法通过社交传播,最终形成了一个非常成功的集体活动。这是一个非常令人惊讶的"涌现"(Emergence)。

当下的LLM多角色实验存在以下问题:

  • LLM作为已经训练好的模型,输入Prompt后该LLM模型只会进行推理(Inference),而不会根据压力调整权重
  • LLM是一次性训练好的,无法持续学习

Alice作为一个动漫角色,其很多特征都是想实现AGI必须实现的问题:

  • 神经网络非冻结态——"成长能力"
  • 是否选择覆盖旧的权重——"理解能力"
  • 解决对齐问题:如何建立核心价值观
  • 内在动机的涌现
  • 世界模型
  • 稳定性:不会被轻易污染或崩溃

刀剑神域在概念上启发了我,而Joon的作品则在技术上启发了我。我想结合两者,制作一个包含巨大地图、诸多角色,以及人类可以潜入的一个"真实"的世界。

Demo架构图1 Demo架构图2 Demo运行结果