🚦 给每个任务派对的"员工"
智能路由 · 多模型调度 · 成本 —— 费曼人话版
智能路由与调度经济学 · 证据来自 16 篇论文/官方文档实测 + 苏格拉底 13 问 · 2026-06-14
本文为个人 AI OS(林爝 · Eosphor)建设过程中的研究底稿,已移除内部任务标识后公开。
TL;DR · 一分钟拎清
路由就是"任务来了派给哪个模型(员工)干、顺便算钱"。这件事学界早做烂了,但有三个反直觉的实测结论,直接打到我们的设计假设上:① 多模型混着用不是无脑赢,掺个弱的反而倒亏;② 简单"查历史"经常打赢复杂学习算法;③ 没有任何路由器样样通吃。 好消息是,有篇论文恰好用数据证明了"按每个人单独建模"的直觉是对的。结论方向:先用最简单的(静态表+查历史)起步,把复杂学习路由当"以后解锁的实验",别一上来当底座。

🎯这维度到底在解决啥

一个任务进来 —— 写代码、draft 邮件、理思路、查资料 —— 该派给哪个模型干?核心就一句话:杀鸡不用牛刀,屠龙才上宝刀。 简单常见的活,派给便宜的国产模型;难的、重要的、要负责的活,才上贵的旗舰,甚至拉几个一起"会诊"。路由就是这个"派活的调度台",它要同时权衡三件事:质量好不好、花多少钱、跑多快

三个反直觉发现(学界用数据打脸常识)

这是这次调研最有价值的部分 —— 三条实测结论,每条都动摇了一个我们原本以为理所当然的假设:

常识 ①
"多模型一起上,肯定比单个强" —— 错
实测(Self-MoA 论文,arXiv:2502.00674):掺不同模型经常拉低质量。只用单个最强模型多想几遍再综合,反而比"混一堆模型"在评测上高 6.6%、平均高 3.8%。关键:质量 > 多样性,混进一个弱模型会把整锅汤带坏。 → 对 vyane: Fusion"会诊"必须挑人(门控选型) —— 按任务挑 2~4 个"够强且互补"的进面板,绝不能把国产六档全丢进去。同时保留"单个强模型多采样"作为一种备选打法。
常识 ②
"路由当然要上机器学习,越智能越好" —— 不一定
实测(RouterArena + arXiv:2505.12601):简单的"查历史相似任务"(kNN),经常打赢花哨的学习路由器 —— 样本更省、还更好解释。复杂模型在数据没攒够之前,就是个昂贵的随机数生成器。 → 对 vyane: 这正好印证苏格拉底的第一问 —— 先用最笨的办法(一张静态表 + 查历史)起步,智能学习路由留到 raw data 真攒够了再上。这跟本系统"先稳后抽取"的原则一致。
常识 ③
"总能找到一个最好的路由器" —— 没有
实测(RouterArena 实测 12 个路由器):五个指标(准确率/省钱/最优性/稳定/速度)没有任何一个路由器全部通吃,各有各的强项弱项。 → 对 vyane: 别幻想做出"完美路由器"。接受取舍,按自己的目标函数定权重 —— 若目标是探索学习 > 省钱,那"质量/多样性"的权重就该比一般人调得高。

一个好消息:学界证明"按人建模"的直觉对了

🥬 萝卜青菜各有所爱 —— 有数为证

有篇论文(GMTRouter,arXiv:2511.08590)测出:全局平均口味只能对 65.99% —— 也就是说"大众都爱哪个模型"这种平均答案,有三分之一的时候是错的,因为每个人想要的根本不一样。而同一个人自己的偏好却很稳定。这就是"给每个 user 单独建模"值得做的硬证据,直接撑住"类 FSRS、越用越懂你"的设计。

🧊 冷启动不可怕 —— k=10 就破冰

"新用户没历史数据怎么办"的担心,同一篇论文给了答案:只要 10 条交互历史,新用户的效果就≈老用户(几乎不掉点)。所以"每个人单独建模"的冷启动焦虑,有现成解法 —— 用全局经验当起点,10 条就开始个性化。

🗺️成熟方案速览(三种派活打法 + 怎么串起来)

路由不是单一动作,是"分流 + 沉淀数据"。三种主流打法,用看病打比方最好懂:

🏥
级联(cascade) = 看病分级。先上便宜的(社区医院),配一个"够好就停"的判断器;不够好再升级到贵的(转三甲)。省钱之王 —— 最多省 98% 成本(FrugalGPT)。代价:慢(可能多跑几趟),实时聊天要限"最多升 2~3 级"防卡顿。
👨‍⚕️
融合(fusion / MoA) = 专家会诊。几个模型一起答,再一个"主任医师"综合。效果好,但贵 4~5 倍。Fusion 就是它的产品化(下一节细说)。关键:会诊要挑人,别拉庸医进来(见反直觉①)
🎰
老虎机(contextual bandit) = 试餐馆。大部分时候去已知好吃的(利用),偶尔故意试新店(探索),不然永远发现不了新欢。这是"越用越懂你"能持续进化的引擎 —— 但必须保留"探索"那一点点,否则路由会锁死在早期赢家上,新上线的更强模型永远没机会。推荐用 LinUCB(稳、好解释、适合冷启动),别上重型深度强化学习。
graph TD
  A["📥 任务进来
(带:什么活 + 谁发起的)"]:::in A --> B{"有客观标准答案吗?
(代码能跑/数学对错)"}:::q B -->|"有"| C["✅ 执行结果当裁判
(最硬的真值)"]:::hard B -->|"没有"| D{"任务难度/重要性?"}:::q D -->|"简单常见"| E["🏥 级联:便宜的先上
够好就停"]:::cas D -->|"难/重要/要负责"| F["👨‍⚕️ 融合:挑2~4个
互补的会诊"]:::fus C --> G["📊 落 raw data
谁发起·选了谁·评分多少"]:::data E --> G F --> G G --> H["🧠 喂 per-user 学习
越用越懂用户"]:::learn H -.下次更准.-> A classDef in fill:#1a2740,stroke:#6aa6f5,color:#fff; classDef q fill:#241d14,stroke:#f0c674,color:#fff; classDef hard fill:#15321f,stroke:#5fd0a0,color:#fff; classDef cas fill:#1f2a45,stroke:#8194b5,color:#fff; classDef fus fill:#2a2238,stroke:#c79bf0,color:#fff; classDef data fill:#1f2a45,stroke:#6aa6f5,color:#fff; classDef learn fill:#2a1f12,stroke:#f0a060,color:#fff;
路由的全貌:不只是"挑模型",而是"分流 → 干活 → 把'谁干的/干得怎样'记下来 → 喂给学习 → 下次更准"。工程地基可直接借现成开源:LiteLLM(负载均衡/限流了自动换备用)、RouterBench(40 万条离线数据,先把路由练到不傻再上线)。

🔬Fusion 证据 —— 这维度的实证锚(承上一轮)

作为调研起点的那篇 OpenRouter Fusion,本质就是"融合(MoA)"这条路的产品化。调研把它的细节核实清楚了,作为这维度的实证:

跑法得分(DRACO 评测)说明
Fable 5 单模型(贵旗舰)65.3%基准线
Fable 5 + GPT-5.5 会诊 + Opus 4.8 当裁判69.0%会诊 > 单专家
纯省钱组合(Gemini Flash + Kimi K2.6 + DeepSeek V4 Pro)64.7%≈ 旗舰,成本砍半还多

它的"裁判"产出五件套 —— 共识 / 矛盾 / 谁没覆盖到 / 独到见解 / 集体盲区 —— 这正好是 vyane 交叉评分的天然采集口:每跑一次 Fusion,白送一批"哪些模型在这类任务上互相印证/打架"的训练数据,强烈建议直接落库。

⚠️ 边界(上一轮已说,这里重申):Fusion 是单次、无工具、无记忆的"答案融合",只验证了 vyane 的"广播+会诊"这一块肌肉,不等于验证整个组织底座;数字是 OpenRouter 自家测的;且大规模流量的结论搬到 N=1 的个人场景要打折,得自己跑小实验立证。

⚖️裁判的毛病 —— "AI 交叉评分"能不能立住

本系统计划让 AI 互相打分当数据基底。学界给这套"既背书、又补漏":AI 当裁判有三个已证的毛病,现有设计防住了一个,漏了两个 ——

👨‍👦
偏爱自己徒弟(self-preference):AI 给"跟自己像"的答案打分系统性偏高。根因已查明 —— 它对熟悉的东西(低困惑度)就是更顺眼。"自评低权重"的设计对了、有论文撑;加固:要按"模型家族"降权(GPT-5.5 给 GPT-5.2 打分也得降,不只同名)。
📏
偏爱长篇大论(length bias):裁判倾向给更长更啰嗦的答案高分。⚠️ 现有设计没防这个 —— 是漏洞。补:做长度控制,或在评分指令里明令"不许以长论高下"。
🔢
偏爱先看到的(position bias):两两对比时偏爱排在前面的。⚠️ 现有设计也没防 —— 漏洞。补:交换顺序跑两次取平均。
📐 真值分层:打分要有标尺

能用尺子量的,就别让 AI 用眼估。 代码能不能跑通、数学对不对、检索命没命中 —— 这类客观真值最硬,一律用执行结果当裁判,禁用 AI 评分。AI 互评只在"压根没标准答案"(比如 draft 邮件、理思路)时当低权重兜底。这条必须锁死,否则数据基底会被"刷榜/讨好裁判"污染。

🗿苏格拉底最扎心的几问(从 13 条里挑最尖的)

① 元问题:N=1 就上了 N=10000 的复杂度? 当前就一个用户、个人任务量。交叉评分 + per-user 建模 + 四信号 + 反刷榜 + CIO 治理 —— 这一整套,会不会在数据攒够之前,一张手写静态表就够用 95% 场景?(调研的反直觉②给了同样的答案:简单方法常更优。)
② "成本"到底怎么定义? 火山是包月、百炼是按量、Opus 是订阅。一个已经包月付掉的模型,边际成本近乎 0,省它的钱毫无意义。"省 80%"是真省,还是把已沉没的包月额度算成了节省?这个定义不钉死,整个经济优化在优化幻觉。
③ 大部分个人任务根本没有对错信号,路由拿什么学? "draft 这封邮件""理一下想法" —— 事后永远无从知道当时换个模型是不是更好。有客观真值的任务(代码能跑)可能只占一小撮。那"在线学习"实际只在很窄的子集上发生。
④ 信息茧房:越懂用户 = 越窄。 "越用越懂你"的暗面是,它学到用户过去爱什么就一直喂同类,新模型、新风格被边缘化。这跟"探索 > 一切"的目标函数直接对着干 —— 是价值观级的反目标。

🤝悬而未决的 4 个方向问题

技术细节燧能落地,但下面这几个是价值观 / 方向层面的选择,系统自己定不了:

1 · 智能路由,先简后繁,还是直接上学习算法?

三个反直觉发现 + 苏格拉底元问题,都指向同一答案。

我的推荐:先用"静态表 + 查历史相似任务"起步(简单方法常赢),把交叉评分 + bandit 学习路由当成"raw data 攒够后才解锁的实验",不当底座。这最省力、最可解释、也最符合"先稳后抽取"。
2 · "探索"的权重,定多高?

若目标函数是探索学习 > 省钱,那"老虎机"里"试新店"的比例就该比一般人高,信息茧房要主动破(强制定期采样新模型/新风格)。

开放问题:愿意为"保持新鲜、不被茧房困住",牺牲多少"贴合度"和成本?这由目标函数说了算,系统照着配。
3 · 成本红线 —— 哪些任务"再贵也不能省"?

对外发布的内容、涉及事实正确性的、不可逆操作的辅助判断 —— 这些便宜模型省的钱远不抵翻车代价。这条线不能交给"被省钱奖励驱动"的路由自己判。

需要的产出:一份"再贵也不能降级"的任务红线清单,路由无权下穿,由 CIO 治理层守。(跟既定的"质量降级必须人拍板"原则对齐。)
4 · 愿意花多少人工,当 AI 评分的"真值锚"?

没有任何人类校准,AI 互评迟早跑偏(只会越来越懂"怎么讨好裁判",不是"什么是真的好")。但人的角色不该是免费标注工。

开放问题:愿意多久抽检一次、标多少条当锚点?(哪怕每周 10 条高价值样本,都能拉住校准。)

🚧7 条硬规矩(给燧落地时的红线 checklist)

  1. 真值分层、客观优先:能客观验证的任务(代码过测试/数学对答案)一律用执行结果当 reward,禁用 AI 当裁判;交叉评分只作无客观真值场景的低权重兜底。
  2. 去偏三件套必做:自偏好按"模型家族"降权 + 两两评分交换顺序取平均(防位置) + 长度控制(防啰嗦)。后两个是现设计的漏洞。
  3. 老虎机必须保留"探索":否则路由锁死早期赢家,新上线的更强模型永远学不到,"持续进化"成空话。
  4. Fusion 会诊必须门控选型:禁止把整个模型池无差别并行;只放"够强且互补"的(Self-MoA 反例的教训)。
  5. 路由绑"能力档"不绑模型名:六档池换型、上下线模型时不用重训。
  6. per-user 成本归账闭环:每个请求必须落"谁发起的",否则 CIO 治理和 per-user 预算都是空的。(可套成熟的 virtual-key 范式。)
  7. benchmark 只加权不主导:以实际场景 raw data 为主 —— 多份实测都证明静态 benchmark 路由脆弱、易被刷榜。
TL;DW(太长没跟流程):路由这事成熟方案一大把,但三条实测打脸常识 —— 多模型混着不是无脑赢(要挑人会诊)、简单查历史常赢复杂算法(先别过度工程)、没有完美路由器(接受取舍)。学界还顺手证明了"按人建模"的直觉对(全局口味只能对 65.99%),冷启动 10 条就破。方向建议:先用最简单的静态表 + 查历史起步,智能学习路由当"以后解锁的实验";Fusion 值得做但要门控;评分基底补两个去偏漏洞、锁死"客观真值优先"。

下一步:路由与经济只是整个体系要回答的维度之一,"身份/persona 蒸馏""失败/恢复""交互层""演进/学习"几条线仍待深挖;上面 4 个方向问题有了答案,这一维度就能收口落地。
图没显示就联网刷新一下(mermaid 走 CDN)。