维度直查路由
把「任务需要什么能力」显式分解,直接路由到对应维度最强的模型,
不经过中间表示。相比隐式路由,推理深度提升 25.9%。
单个模型的能力有边界。RRLab 的研究不是寻找更强的模型,
而是回答:如何把多个各有所长的模型组织成一个系统,
让它在已知知识边界内可靠交付,在边界外产生可验证的新知识,
并且治理规则由系统自己生成。
四条研究线,每条都有公开发表的实证。
把「任务需要什么能力」显式分解,直接路由到对应维度最强的模型,
不经过中间表示。相比隐式路由,推理深度提升 25.9%。
受量子测量结构启发的纯经典框架:做出判断之前,系统保留
「多个可能世界的分布」,而不是过早坍缩成单一置信分数。
这个分布被映射为可审计的路由:自动通过、人工复核、降级、弃权。
要防止的不是 AI 犯错,而是 AI 带着高置信度犯错。
幻觉无法围堵,但可以疏导。探索模式下,多个模型对同一对象
做互补视角的独立分析;不追求共识,而是检测「共振」——
不同模型从不同路径收敛到结构上兼容的解释。
共振方向进入计算证伪队列。在 BSD 猜想研究中,
强共振假设 6/7 经受住了后续验证。
编排规则不由人类预设堆叠,而由推理模型从系统不变量演绎生成。
消融实验:演绎式 96/100,归纳式 76/100。
更大规模的实验中,只给最小约束(探索 + 共振检测)的系统
自组织出依赖感知批处理和跨模型信息共享——
论文称之为「最小约束下的有序行为」,观察到,未解释。
跨项目一致的工程经验:人类加微观约束,产出质量反而下降。
上面四条研究线的运行载体。多模型编排 + 多维度评估层
(50 任务 benchmark),支持确定性与探索性双模式运行。
规模最大的一次实验:15 个 Skill、7+ 异构模型、
77 次工具调用、74 分钟自主运行。
多模型协同的全栈产品化。
eVoiceClaw(iOS 语音助手,多提供商可切换)、
Desktop(多 Agent 协同工作台)、
Pro(完全本地化的专业知识库,面向医生/工程师)、
Cerebellum(端侧「小脑」模型:语义路由 + 隐私感知 + 安全审查)。
从 Swift 前端到 Python 后端到 Agent 编排,全链路自建。
Agent 代码修改能力审计。不排名模型,回答两个工程问题:
改完代码,原本通过的测试还过吗(FRR)?
同等质量下,谁更快、更省、更便宜?
第一层 Mac-TTS(v0.1 已发布,开源):把每台 Mac 的内置语音
变成 Unix 管道。零磁盘 IO、纯 CPU 推理,TTS + STT 一体。
第二层(开发中):带情绪控制的多角色配音,当前借助云 TTS。
从「测模型」走向「测与进化 Harness」:
模型外围的运行时系统(工作流、评估、权限)
如何被系统化地评估与改进。
全部预印本发布于 Zenodo,DOI 可点击验证。
ORCID: 0009-0004-3898-4655
使用自建多模型编排系统实证
共振探索模式的应用验证;SageMath 大规模计算 + Magma 精确验证 + AI 辅助研究
独立 Forward Deployed Engineer 服务。
RRLab 的研究不是纸上谈兵——四模式协同、benchmark 评估、
不确定性路由,都是可以直接嵌入你业务系统的工程方法。
嵌入你的团队,把大模型从 Demo 变成生产线上的生产力。
数学研究者 × AI 系统构建者 × 独立 FDE。
学术背景为计算数论,研究椭圆曲线与 BSD 猜想的数值验证方法。近年的工作重心是 AI 系统工程:多模型协同、Agent 评估、不确定性路由。RRLab 是这些工作的统一载体。
这里的方法论不是从报告里读来的:在 BSD 猜想研究中,用多模型 AI 系统做出了可发表的发现——共振模式提出假设,确定性计算完成证伪,13 篇论文是副产品。从零构建了 eVoiceClaw 全栈产品族,四条产品线。自建 benchmark 量化对比模型能力,每个选型决策有测量依据。
在完全不确定的问题上做前沿探索并产出结果——大多数业务问题不会比这更难。
有 AI 落地的想法但不知道从哪里开始?聊聊,没有压力。