纲领 项目 出版物 博客 Digest FDE 关于 联系 EN
RRLAB — INDEPENDENT AI RESEARCH LAB

一个独立 AI 实验室,
持续输出研究、工具与产品。

RRLab 是 Rodney Rui 的独立实验室。
方向包括:多模型协同、AI 选型评测、AI 原生产品。
研究结论变成可用工具,工具支撑工程交付。

FEATURED · R2DF BY RRLAB
Follow Your Life

轮式生活助理概念:跟着走,也能走在前面带路;未来语音指令。时尚单品气质,具身智能触手可及。

查看概念页与主题曲 →
13
论文预印本
3
模型训练与引擎
9
开源项目
17
落地、在研项目
01

研究纲领
可靠 × 创造力 × 自治理

单个模型的能力有边界。RRLab 的研究不是寻找更强的模型,
而是回答:如何把多个各有所长的模型组织成一个系统,
让它在已知知识边界内可靠交付,在边界外产生可验证的新知识,
并且治理规则由系统自己生成。
四条研究线,每条都有论文与可运行的公开实证。

01

维度直查路由

把「任务需要什么能力」显式分解,直接路由到对应维度最强的模型,
不经过中间表示。相比隐式路由,推理深度提升 25.9%。

→ 论文:Dimension-Direct Routing(DOI: 10.5281/zenodo.19504212

02

不确定性路由(BPL/OA)

受量子测量结构启发的纯经典框架:做出判断之前,系统保留
「多个可能世界的分布」,而不是过早坍缩成单一置信分数。
这个分布被映射为可审计的路由:自动通过、人工复核、降级、弃权。
要防止的不是 AI 犯错,而是 AI 带着高置信度犯错。

→ 论文:BPL/OA: Auditable Uncertainty Routing(DOI: 10.5281/zenodo.19936937

03

共振探索

幻觉无法围堵,但可以疏导。探索模式下,多个模型对同一对象
做互补视角的独立分析;不追求共识,而是检测「共振」——
不同模型从不同路径收敛到结构上兼容的解释。
共振方向进入计算证伪队列。在 BSD 猜想研究中,
强共振假设 6/7 经受住了后续验证。

→ 论文:Deliberation and Exploration(DOI: 10.5281/zenodo.19505278
→ 案例研究:From Resonance to Rigor(DOI: 10.5281/zenodo.21500421

04

AI 治理 AI

编排规则不由人类预设堆叠,而由推理模型从系统不变量演绎生成。
消融实验:演绎式 96/100,归纳式 76/100。
更大规模的实验中,只给最小约束(探索 + 共振检测)的系统
自组织出依赖感知批处理和跨模型信息共享——
论文称之为「最小约束下的有序行为」,观察到,未解释。
跨项目一致的工程经验:人类加微观约束,产出质量反而下降。

→ 论文:LLM-Skill Orchestration(DOI: 10.5281/zenodo.19503674

02

项目
研究在哪里落地

01

多模型协同系统持续开发 · 产出 5 篇论文

上面四条研究线的运行载体。多模型编排 + 多维度评估层
(50 任务 benchmark),支持确定性与探索性双模式运行。
规模最大的一次实验:15 个 Skill、7+ 异构模型、
77 次工具调用、74 分钟自主运行。

链接:github.com/rrlab-tech(随 RRLab-Bench 逐步开放)

02

eVoiceClaw 产品族四条产品线并行开发

多模型协同的全栈产品化。
eVoiceClaw(iOS 语音助手,多提供商可切换)、
Desktop(多 Agent 协同工作台)、
Pro(完全本地化的专业知识库,面向医生/工程师)、
Cerebellum(端侧「小脑」模型:语义路由 + 隐私感知 + 安全审查)。
从 Swift 前端到 Python 后端到 Agent 编排,全链路自建。

03

RRLab-Benchv0.3.3 已发布 · 开源

Agent 代码修改能力审计。不排名模型,回答两个工程问题:
改完代码,原本通过的测试还过吗(FRR)?
同等质量下,谁更快、更省、更便宜?

链接:github.com/rrlab-tech/rrlab-bench

04

RRLab-Benchmarkv1.0 已发布 · 开源

面向中文场景的多维度 LLM 能力评测框架。
89 题 × 13 维度,四级难度(含 expert)加权评分,
6 种评分方式,12 家 Provider 预置配置。
与 RRLab-Bench 互补:通用能力定基线,Agent 能力验工程。

链接:github.com/rrlab-tech/rrlab-benchmark

05

RRLab-BPL-OAv1.0 已发布 · 开源

不确定性路由引擎:把景观不确定性分解为两个正交成分——
占据率(这个尺度有信号吗?)× 幅度(信号多强?)。
检测 toward-1 硬化(高置信假安心),修复经典 BPL 带的
覆盖率崩溃。领域无关:点云进,QA 决策出。

链接:github.com/rrlab-tech/rrlab-bpl-oa

06

RRLab-Stock-QAv0.1 已发布 · 开源

BPL/OA 引擎的参考应用:股票筛选 QA。
不预测股票,审计筛选器输出分布——批次健康度、
个股置信度标记、阈值标定,检测过度自信区间。
方法论与代码全公开(论文 DOI 可查)。

链接:github.com/rrlab-tech/rrlab-stock-qa

07

语音工具链两层架构,第一层已发布

第一层 Mac-TTS(v0.1 已发布,开源):把每台 Mac 的内置语音
变成 Unix 管道。零磁盘 IO、纯 CPU 推理,TTS + STT 一体。
第二层(开发中):带情绪控制的多角色配音,当前借助云 TTS。

链接:github.com/rrlab-tech/mac-tts

08

Bench-Harness研究进行中

从「测模型」走向「测与进化 Harness」:
模型外围的运行时系统(工作流、评估、权限)
如何被系统化地评估与改进。

09

嘱理师开发中

数字资产与遗嘱管理 iOS App。资产录入与受益人管理、
生命确认与投递、验证码身份校验。
免费 / 年费 / VIP 三级用户体系。
iOS 工程与后端 API 同步开发。

10

剧后书开发中

漫剧党的原著听读 App。看完短剧,导入原著 TXT,
目录检索 + 分级 TTS 听读。
终局方向:角色识别 → 每角色分配音色 → 逐句合成的 AI 自动配音。
Flutter 独立工程。

11

RRLab Digest已上线 · 开源

AI 行业深度内容情报站。每日自动采集 100+ 技术博客、
arXiv 论文、HackerNews 讨论和 GitHub 仓库,
由 DeepSeek V4 Flash 三维打分(深度、相关度、偏好匹配),
分池排名(论文/博客/开源/社区),入选文章生成结构化精读笔记。
完全自动化,每日凌晨 3:00 运行。

链接:digest.rrlab.tech · github.com/rrlab-tech/rrlab-digest

12

RRLab-News-Dashboardv0.1 已发布 · 开源

全球热点新闻聚合仪表板。中国热榜(微博/知乎/抖音等 14 平台)
+ GDELT 全球新闻 + HackerNews + RSS + 金融新闻 + A股财报。
SimHash 智能去重,10 分钟自动刷新,
React 响应式仪表板,Docker 一键部署。

链接:github.com/rrlab-tech/rrlab-news-dashboard

13

RRLab-Cerebellumv1.0 已发布 · 开源 · HF 模型

端侧语义路由模型(自训)。bge-m3 基座 + 15 维意图回归头,
51.4M 可训练参数,常驻内存约 1GB——把用户消息转成
意图向量,替代 Agent 路由中的 LLM 调用。毫秒级响应。
代码开源 + HuggingFace 增量权重发布(202MB)。

链接:github.com/rrlab-tech/rrlab-cerebellum · HF: cerebellum-v1

14

R2DF · Follow Your Life概念发布 · FDE 案例

轮式生活助理产品概念:跟随载物、带路、语音指令路线图;宣传语 Follow Your Life。
概念三视图、跟随视频与主题曲已上线。

概念页:rrlab.tech/projects/follow-cart/ · 案例:fde.rrlab.tech#cases

15

门禁 OCR 识别系统已交付 · FDE 案例

门牌地址识别垂直方案。YOLOv8 检测 + PaddleOCR 识别 +
中文数字归一化(「二十」→「20」)+ 地址组装。
自建自动标注管线,人工工作量降 90%,数据量达十万级;
识别准确率 acc 0.9962。作为 FDE 咨询案例交付。

案例详情:fde.rrlab.tech#cases

16

LLM 身份认知偏差与任务失败研究在研

基于 bench-harness 判别性探针,实证了模型身份认知错位与任务失败之间的因果链。
实验室环境稳定复现:模型读取环境变量 PI_MODEL=deepseek 后,仍有 3/4 次在输出中自称 Claude。
结合 Spartacus(25.93% 混淆率)、ICML 2026 Role Confusion(位置衰减效应)等前沿文献,
建立了「观测现象 → 文献验证 → 可重复探针 → 修复方案」的完整数据闭环。
初步结论:身份认同无架构级彻底解,但可通过「开发者消息字段 + 运行时强制核对 + 长会话周期重注入」在可控范围内接近解决。

研究存档:rrlab-bench · bench-harness 探针体系

17

ModelCFOv0.1 已发布 · 开源 · 新项目

AI 账户资产管理桌面应用。统一管理 DeepSeek、Kimi、OpenRouter 等 13 家 AI 提供商的余额、配额、订阅、续费日期。
Tauri 2 + Rust + Svelte 5,本地优先,凭据仅存系统钥匙串,数据不出本机。
CNY / USD 货币分离,多窗口用量(5h/周/加油包),数据可信度分级。
macOS / Windows / Linux 跨平台。

链接:github.com/rrlab-tech/model-cfo

03

出版物
纲领的落地

全部论文预印本发布于 Zenodo,DOI 可点击验证。
ORCID: 0009-0004-3898-4655

方向一:AI 多模型协同系统

使用自建多模型编排系统实证

方向二:计算数论 / BSD 猜想

共振探索模式的应用验证;SageMath 大规模计算 + Magma 精确验证 + AI 辅助研究

04

FDE 咨询
研究能力,按项目交付

独立 Forward Deployed Engineer 服务。
RRLab 的研究不是纸上谈兵——四模式协同、benchmark 评估、
不确定性路由,都是可以直接嵌入你业务系统的工程方法。
嵌入你的团队,把大模型从 Demo 变成生产线上的生产力。

202/202
50 任务 agentic benchmark 子任务全通过
96 : 76
消融实证:演绎式规则生成优于人类预设堆叠
6/7
强共振假设经受住后续验证
6
交付案例,逐个可验证
05

关于 Rodney Rui

数学研究者 × AI 系统构建者 × 独立 FDE。

学术背景为计算数论,研究椭圆曲线与 BSD 猜想的数值验证方法。近年的工作重心是 AI 系统工程:多模型协同、Agent 评估、不确定性路由。RRLab 是这些工作的统一载体。

这里的方法论不是从报告里读来的:在 BSD 猜想研究中,用多模型 AI 系统做出了可发表的发现——共振模式提出假设,确定性计算完成证伪,13 篇论文是副产品。从零构建了 eVoiceClaw 全栈产品族,四条产品线。自建 benchmark 量化对比模型能力,每个选型决策有测量依据。训练了端侧意图路由模型(Cerebellum,已发布 HuggingFace),把不确定性路由方法做成了可复用的引擎(BPL/OA,已开源),并落地了门牌 OCR 等垂直交付。研究结论变成工具,工具全部开源,共 8 个仓库。

在完全不确定的问题上做前沿探索并产出结果——大多数业务问题不会比这更难。

06

联系

有 AI 落地的想法但不知道从哪里开始?聊聊,没有压力。