研究时间:2026-06-17 | 所属领域:AI 通用建模 / 世界模型 / 学习科学 | 研究对象类型:技术范式与愿景定位
用途:为一篇面向公众的深度愿景文章做前置研究——把「用 AI 为世界建模、找通用解法」这件事放进 300 年的思想长河与当下的竞争图谱里,看清它站在哪。
通几·Aletheia:用 AI 加速「建模」——把各专精领域的解综合成能抽象、能泛化的通用解,学过去、懂当下、逼近未来;人与 AI 在一个循环里互教迭代,越建越准;而建模这个过程本身,就是意义。
正名「通几」取自方以智《物理小识》「质测即藏通几」——质测是各学科的实证(专精/术),通几是贯通万物的底层规律(通用/道)。副名「Aletheia」取海德格尔对希腊「真理」的解:去蔽,让被遮蔽的关联显现。一句话:格物以通几,立象以见真。
这件事不新。新的是,它这次也许第一次有了能成的载体。
故事的源头在十七世纪。莱布尼茨想做两件配套的事:一套能精确表达一切思想的「概念字母表」(characteristica universalis),加一台对这些符号做机械运算的「推理演算器」(calculus ratiocinator)。合起来,是要把「思考」和「争论」变成「计算」。他留下一句后来被反复引用的话——两个人吵架时,不必脸红脖子粗,坐下来说一句「Calculemus(我们来算一下)」,像算账一样把谁对谁错算出来。
斯坦福哲学百科里,库蒂拉认为莱布尼茨「已经掌握了后来布尔、施罗德整个逻辑代数的全部原理,某些地方甚至更超前」。但这梦做了个寂寞:手稿生前几乎没发表,锁在汉诺威图书馆里近两百年。后来布尔、德摩根搞出现代逻辑,是独立重新发明的,并非继承自他——他对现代逻辑「是否真有实际影响」,学界至今有争议。更要命的是,他没有载体:再精巧的符号系统,没有一台机器去跑它,就只能停在哲学层。
这是第一个伏笔:通用建模的梦想,缺的从来不是野心,是能跑它的机器。
三百年后,机器来了。1957 年,Newell、Simon、Shaw 在 RAND 造出 General Problem Solver——史上第一个号称「通用问题求解器」的程序。它的野心写在名字里:任何能形式化为良构问题的难题,它都该能解。核心机制叫「手段-目的分析」:不断比较「现在在哪」和「想到哪去」,挑一个能缩小差距的操作,一步步逼近目标。它还做了一件影响深远的事——第一次把「知识」和「求解策略」分开。
然后它撞墙了。墙的名字叫组合爆炸。维基百科记得很清楚:穿过推理图的「走法」数量爆炸式增长,计算上根本不可行,连稍微复杂点的问题都会让搜索空间炸掉,最后只能解几个玩具问题。GPS 标志着早期符号主义 AI「通用求解」梦想的第一次正式幻灭。
这是全文最重要的一条历史教训:通用性,靠纯符号硬搜是会被组合爆炸打死的。 记住这堵墙——后面所有「这次为什么可能不一样」的论证,都要从这堵墙绕过去。
幻灭之后,有一条不起眼的支线,走了完全相反的路:不贪大求全去解「一切」,而是先把一个具体系统精确建模,再求那个系统里的通用最优策略。这条线,是学习科学。
1985 年,波兰人 Piotr Woźniak 拿纸笔开始跟「遗忘」较劲;1987 年他把它搬上电脑,做出 SuperMemo 和 SM-2 算法。他干的事,本质就是给「人脑记忆」这个世界建了个模——后来收敛成三个变量:难度(Difficulty)、稳定性(Stability,记忆能撑多久)、可提取性(Retrievability,此刻能想起的概率)。建好模,就能求一个通用解:在「快忘了」的那个临界点安排复习,用最少的次数换最长的留存。
三十多年后,叶峻峣(网名 L-M-Sherlock)接着往下做。他从「墨墨背单词」的数据和论文起步,用机器学习把 Woźniak 手调的固定公式,换成对每个人、每张卡的个性化拟合——这就是 FSRS,2023 年被 Anki 正式内置,同样的留存率下复习量能砍掉两三成。从 SM-2 到 FSRS,是一个完整的缩影:一个小众的、靠专家手感的建模,被数据和 AI 重做成了开源的通用工具。
而把这条线在中文世界推到「世界模型」高度的,是于建国(B 站叫 YJango,西安电子科技大学博士后)。他的「渐构」——名字本身就是 Model + evolution——把「学习」重新定义成「在大脑里建构、并不断演化一个能预测、能迁移的世界模型」。他反对「仅凭感觉的学习」,认为人和人的天赋差距,本质是「学习这件事本身从没被科学地理解和训练过」。他有一句座右铭,分量很重:「生命的遗产,是对知识的更新。」
这条支线最贴本愿景的母题。它示范的方法论内核就一句:先建模,再求通用最优;不求一步通天,靠数据和 AI 慢慢把它通用化。
到了这几年,通用建模的梦突然又活了,而且是两条腿一起迈。
一条腿在物理世界。李飞飞 2024 年带 World Labs 出山,主张「空间智能是 AI 的下一个前沿」。她对 LLM 有句犀利的判词:今天的大模型是「黑暗中的文字匠——雄辩但没有经验,博学但没有根基」。她说「世界不是由文字构成的」:语言模型学文本的统计结构,世界模型得学空间和时间的统计结构——光怎么落在表面,物体怎么遵守物理。
另一条腿,是把 GPS 那堵墙绕过去的关键。Anthropic 押注 coding,赌的是一个朴素却致命的点:可验证性。代码能编译、能跑测试、能过 CI——它有客观、可自动判定的对错。Anthropic 举 SWE-bench 为例:给模型真实代码库加真实 bug,让它写出能通过项目自带测试的修复。这种「可验证的奖励信号」正是强化学习最需要、而开放式对话给不了的。代码还有另一重身份:图灵完备,能表达任意可计算的问题——这几乎就是莱布尼茨那套 characteristica 的现代回声。
把这两件事接起来,就是全文的因果闭环:GPS 死于「无法判定对错、只能盲搜」;这一次能动,是因为人类找到了一种「图灵完备 + 可验证」的通用语言——代码。 三百年的墙,是从这里翻过去的。
(红线:「coding 能力会外溢提升一切」是 Anthropic 的论断和业界分析,不是已证的科学事实;「8 倍代码产出 / 任务时长每 4 月翻倍」是公司自报数据,引用须标出处。)
如果说前面都还是「主张」,那 AlphaFold 是「证明」。DeepMind 用深度学习,从氨基酸序列直接预测蛋白质的三维折叠——一个困了生物学界整整五十年的难题。过去测一个结构常要一年以上的昂贵实验,它几乎瞬间给出高精度预测,数据库里已经放了两亿多个结构(真做实验要几亿年),190 多个国家、300 万研究者在用。2024 年,Hassabis 和 Jumper 因此拿了诺贝尔化学奖。DeepMind 自己的定调是:这是「AI 能成为推进科学的强大工具的第一个重大证明点」。
从莱布尼茨「算一切」的哲学梦,到 AlphaFold 真的「算出了」蛋白质——通用建模求解的梦想,第一次在硬科学里兑现。这是纵轴的压舱石。
把「为世界建模 / 找通用解 / 学习增强」这条赛道上的玩家拉到同一张桌子上,用三条轴量一量:①生成世界的「样子」↔ 发现世界的「法则」;②纯 AI 自动 ↔ 人在环路;③只是工具 ↔ 带意义/愿景叙事。
| 玩家 | ①样子↔法则 | ②全自动↔人在环路 | ③工具↔意义 |
|---|---|---|---|
| World Labs / Marble | 极偏「样子」 | 偏自动 | 工具 + 空间智能叙事 |
| LeCun JEPA / LeJEPA | 偏「法则」 | 自动 | 纯研究,无意义层 |
| Anthropic/OpenAI/Google agent | 中性(不直接建模世界) | 可调 | 纯工具底座 |
| AlphaFold / Isomorphic | 偏「法则」(窄域折叠) | 偏自动 | 工具(科研/制药) |
| AlphaEvolve | 偏「法则」(算法),被可验证性框死 | 自动但须评估器 | 工具 |
| AI Co-Scientist | 偏「法则」 | 强人在环路 | 工具 |
| Sakana AI Scientist | 偏「法则」 | 最偏全自动(争议大) | 工具 |
| 符号回归 AI Feynman / PySR | 极偏「法则」(直接出方程) | 自动 | 纯窄域工具,无叙事 |
| Anki / RemNote / Obsidian | 不建模世界(记忆/关联) | 工具(人主导) | 纯工具(被批「收藏≠思考」) |
| 渐构 Modevol(于建国) | 「学习的法则」 | 人主导 + AI 辅助 | 唯一强意义叙事 |
Marble(2025-11 发布)能从一张图、一段视频或一句话,生成高保真、可持久、可编辑的 3D 环境,底层是 3D Gaussian Splatting。它把 3D 创作的门槛砸下来了,影视、机器人训练、教育都用得上。但它身上有个核心张力:李飞飞自己叫它 world model,学界一派直接说「This is not a world model」——它是个 3D 场景生成器,重建外观和几何,不建模物理、因果、动力学。有开发者讥讽,那不如直接 text-to-image 再 image-to-splat。生成世界的「样子」,不等于理解世界的「法则」。这是横轴上第一个要划清的边界。
Anthropic、OpenAI、Google 的 agent/coding 路线,本质是给所有人提供「通用执行底座」。Anthropic 甚至明说 Claude Code 已经「远不止是编码工具」,把它的核心循环——收集上下文 → 行动 → 验证 → 再循环——抽象成通用 agent 的需求,改名 Claude Agent SDK。但要看清:这三家是本愿景的基础设施供给方,不是愿景本身。 它们提供「手和脚」,不替人回答「为什么建模、建模为了谁」。在三轴上,它们对「样子 vs 法则」是中性的,对「意义」是缺席的。
这一极最热闹,也最能说明问题,因为它内部就把「人在环路」这条轴演示了一遍:
这一层是离普通人最近的,也是失败得最整齐的。Anki/RemNote 把间隔重复做到了极致(FSRS 砍掉两三成复习量),但它们只优化「记忆留存」,不碰「知识结构化和理解」。Obsidian 这类「第二大脑」更被批得狠:「收藏≠思考」——多数人混淆了「收集」和「理解」,囤了一堆笔记却不做综合的认知苦工;图谱制造「洞察的幻觉」,多数自动连接是语法(词匹配)而非语义;工具越强越要伺候它,时间从「创造知识」变成「维护机器」。
唯一的例外是渐构。于建国把「科学的学习理论」和「AI 辅助」往一起捏,还带着「生命的遗产是对知识的更新」这种强意义叙事——在整张表里,它是唯一一个既谈法则、又谈意义的玩家。但它停在一个单点的教育产品/课程上,不是一个可编程、可生长的个人 AI OS。
把纵轴的三百年和横轴的图谱叠到一起,几个判断自己浮出来。
判断一:本愿景落在一个真实的空白上。 横轴量完,结论刺眼——最热的玩家做「样子」(World Labs),最纯做「法则」的是窄域科研工具(符号回归),通用底座只管「执行」(三大厂),个人层卡在「记忆和关联」(第二大脑)。没有任何一个玩家,把「为世界找法则」的技术雄心、「学习与意义」的人文叙事、「面向个人的可落地 AI OS」这三样合在一起。 它们分散在三类互不往来的人手里。通几·Aletheia 的差异化,不在某一项做得最好,而在这三者的合一。
判断二:「人在环路」不是情怀,是 2026 年学界用一摞论文背书的硬边界。 这一年有一批 arxiv 集中质疑「全自动科学发现」:训练语料过度代表正结果,三阶段管线把这种失真放大两倍多;前沿模型普遍「乐观偏差」,把低质量提案评成可靠;只有当反馈是「真实结构化」的(人或实验在环),AI 的发现量才真涨,把反馈随机打乱后增益就消失。换句话说——纯 AI 自动,在开放问题上会自信地放大自己的盲区。 本愿景把「人在环路、人机互教」写进内核,不是退而求其次,是踩在了当下最硬的证据上。
判断三:历史教训正好为本愿景的方法论背书。 GPS 死于「想一步通用、却被组合爆炸打死」;而真正走通的支线(SuperMemo→FSRS→渐构)走的全是「先精确建模一个具体系统,再让数据和 AI 把它逐步通用化」。本愿景「专精→通用」的路径,不是新发明,是被三百年验证过的那条活路——别一上来就屠龙,先把一件具体的事建模到能跑,再让它长大。
判断四:诚实的边界。 这条路最大的风险,恰恰藏在它最迷人的地方。AlphaFold 之所以成,是因为蛋白质折叠有可验证的真值;AlphaEvolve 的天花板就是「得有可信评估器」。而本愿景想伸手去够的那些最大的问题——怎么学、怎么活、什么有意义——恰恰是最难给出「可验证评估器」的。这意味着,在那些领域,AI 永远只能是「人在环路」里的协作者,给不了标准答案。这不是缺陷,这正是「建模本身即意义」这句话的落点:当答案无法被一次性验证,持续逼近的那个动作,就成了意义本身。
回到开头那句话。莱布尼茨缺的是机器,GPS 缺的是可验证的语言,第二大脑缺的是「为知识建模世界」的内核,符号回归缺的是意义和人。三百年的长河里,每一段都缺一块。通几·Aletheia 想做的,是把这些散落的拼图,第一次拼在一个普通人够得着的地方——并且承认,有些图永远拼不全,而拼的过程本身,就是意义。
纵轴:
- 莱布尼茨:Stanford Encyclopedia of Philosophy https://plato.stanford.edu/entries/leibniz-logic-influence/
- GPS:Wikipedia https://en.wikipedia.org/wiki/General_Problem_Solver ;原始论文 https://stacks.stanford.edu/file/druid:zk239tp3547/zk239tp3547.pdf
- SuperMemo:Woźniak 本人《真实的间隔重复史》 https://www.supermemo.com/en/blog/the-true-history-of-spaced-repetition
- FSRS:GitHub https://github.com/open-spaced-repetition/free-spaced-repetition-scheduler ;叶峻峣 Notion 史 https://l-m-sherlock.notion.site/The-History-of-FSRS-for-Anki-1e6c250163a180a4bfd7fb1fee2a3043
- 于建国渐构:官网 https://www.modevol.com ;网易专访 https://www.163.com/dy/article/J0S1NDVP05259U67.html
- 李飞飞 World Labs:《From Words to Worlds》 https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence ;World Labs 博客 https://www.worldlabs.ai/blog
- Anthropic coding:《Recursive self-improvement》 https://www.anthropic.com/institute/recursive-self-improvement ;SWE-bench https://www.swebench.com/
- AlphaFold:DeepMind《Five Years of Impact》 https://deepmind.google/blog/alphafold-five-years-of-impact ;诺奖演讲 https://www.nobelprize.org/uploads/2024/12/hassabis-lecture.pdf
横轴:
- World Labs/Marble 争议:https://www.banandre.com/blog/fei-fei-li-world-labs-marble-gaussian-splatting-world-model-debate ;TechCrunch https://techcrunch.com/2025/11/12/fei-fei-lis-world-labs-speeds-up-the-world-model-race-with-marble-its-first-commercial-product/
- 三大厂 agent 策略:https://www.mindstudio.ai/blog/anthropic-vs-openai-vs-google-agent-strategy ;Anthropic agent 哲学 https://claude.com/blog/building-agents-with-the-claude-agent-sdk
- AlphaEvolve:https://arxiv.org/pdf/2506.13131 ;AI Co-Scientist:https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/
- 符号回归 AI Feynman:Science Advances https://www.science.org/doi/10.1126/sciadv.aay2631
- 第二大脑批判:https://medium.com/@ann_p/your-second-brain-is-broken-why-most-pkm-tools-waste-your-time-76e41dfc6747 ;https://josiahalenbrown.substack.com/p/the-trap-of-pkms
- LeCun JEPA/LeJEPA:V-JEPA https://ai.meta.com/blog/v-jepa-yann-lecun-ai-model-video-joint-embedding-predictive-architecture/ ;LeJEPA 解读 https://www.turingpost.com/p/lejepa
- 「全自动 AI 科学家」质疑:arxiv 2605.08956 / 2606.04220 / 2605.30329 / 2603.26177
方法论:横纵分析法(纵轴追时间深度、横轴追同期广度、最终交汇出判断),由数字生命卡兹克提出。本报告纵横素材由两路并行联网搜集(多源搜索 + arxiv + 一手源);个别页面(叶峻峣 Medium、知乎 p/675151917)被 CAPTCHA/403 拦截,已用一手源补齐。