Macaron V1开源:Mind Lab用LoRA混合架构撬动748B参数,两周ARR破千万美元

Macaron V1开源:Mind Lab用LoRA混合架构撬动748B参数,两周ARR破千万美元

2026年7月21日,Mind Lab正式发布Macaron-V1——首个基于GLM-5.2进行后训练的MoE模型。

这不是一次普通的模型发布。两周ARR突破千万美元、全球唯二能同时开机数百个万亿参数大模型RL训练的Infra团队、站在GLM-5.2和Qwen 3.6肩膀上……Macaron V1正在证明一件事:AI的下一个时代,不是靠"变大"赢的,而是靠"变聪明"赢的。

Macaron V1 Mixture-of-LoRA架构

一、Macaron V1是什么?

Macaron V1是Mind Lab旗下首个正式版本的Agent模型,专为Agent任务打造。它不是从零训练的,而是站在巨人的肩膀上——基于已有顶尖开源模型进行后训练。

| 变体 | 参数规模 | 基座模型 | LoRA专家 | 定位 |
|------|---------|---------|---------|------|
| Macaron-V1-Venti | 748B | GLM-5.2(744B基座) | 4个1B | 旗舰模型,首个在GLM-5.2上后训练 |
| Macaron-V1-Coding-Venti | 748B | GLM-5.2+编程基座合并 | 4个1B | 编程专用,开箱即用 |
| Macaron-V1-Tall | 50B | Qwen 3.6(35B基座) | 4个3.7B | 小号模型,适合本地部署 |

所有变体均以开放权重形式发布在Hugging Face,同时提供官方托管API。

二、核心创新:Mixture-of-LoRA架构

Macaron V1最核心的技术创新是Mixture-of-LoRA(MoL) ——混合LoRA架构。

传统做法 vs Macaron做法

传统大模型的思路是:训练一个巨大的模型,什么任务都往里面塞。越做越大,越做越贵。

Macaron的思路完全不同:

  • 冻结基座模型(GLM-5.2的744B参数不动)

  • 在上面挂载4个轻量级LoRA专家(每个仅1B参数)

  • 每个专家负责不同任务领域

  • 运行时由L0路由器动态选择最合适的专家
  • 四个LoRA专家分工

    | 专家 | 名称 | 职责 |
    |------|------|------|
    | L0 | Chat | 对话和指令跟随的主干,负责路由 |
    | L1 | Agent | 长程动态复杂任务的工具使用 |
    | L2 | Coding | 代码理解、SWE任务、终端操作 |
    | L3 | GenUI | UI4A渲染和UI驱动操作 |

    运行时,L0将每个新用户请求路由到最合适的专家,后续推理和工具交互保持在选定的LoRA内。各专家维护自己的执行上下文,通过简洁的摘要共享已完成的工作。

    这套架构的真正威力在于:它天然适配持续学习。 新能力可以通过即插即用的LoRA添加,无需修改或覆盖基座模型已有知识。

    三、性能:对标GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro

    Mind Lab在发布时直接将Macaron V1与全球顶尖模型进行了全面对比。

    综合评测

    Macaron-V1-Venti在聊天、编程、智能体、GenUI四项任务中的综合能力都超过了GLM-5.2基座模型。相比GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、MiniMax M3,仅在智能体和编程的少数几个测试集中分数略低。

    个人智能评测(Macaron独创)

    Mind Lab认为,传统基准测试无法衡量"个人智能"——模型是否真正在日常生活中帮助用户,并随着使用时间增长变得更有用。为此开发了两个专属基准:

  • Macaron ChatBench:评估模型在复杂长篇对话中的诚实性——知道该说什么、不该说什么、何时主动承认错误

  • Macaron LivingBench:通过数周的持续互动评价Agent性能,模拟真实生活场景
  • 第三方评测

    在LivingBench和第三方测试系统PinchBench上,Macaron-V1-Venti的能力已与GPT、Claude等通用顶尖大模型相当。其优势集中体现在需要长周期、动态环境、持续目标的智能体任务中。

    四、成本优势:全参数微调的1/10

    LoRA架构带来的不仅是灵活性,还有巨大的成本优势。

    根据研究论文,在Kimi K2系统中,LoRA方案将算力与通信开销降至传统全参数强化学习方案的约10%,同时保留对万亿规模基座模型进行适配优化的能力。

    | 对比维度 | 全参数微调 | Macaron MoL |
    |---------|-----------|-------------|
    | 可训练参数 | 全部 | 仅LoRA适配器(1B/个) |
    | 算力开销 | 100% | ~10% |
    | 通信开销 | 100% | ~10% |
    | 基座模型 | 每次微调需独占 | 多任务共享冻结基座 |
    | 持续学习 | 困难(易遗忘) | 天然适配(即插即用) |
    | 个性化 | 难以隔离 | 每用户独立LoRA |

    Mind Lab推出的MinT(MindLab Toolkit) 基础设施可以管理百万级LoRA策略资源库,在共享万亿参数基座模型的基础上完成指定适配器的训练与在线推理。

    五、LongStraw:让RL训练突破百万Token

    Macaron V1的另一个技术亮点是LongStraw——一套超长上下文强化学习训练系统。

    突破了什么瓶颈?

    长上下文推理已经突破了百万Token,但长上下文RL训练一直卡在256K左右。原因是RL训练需要保留前向计算图、评分多个响应、在同一prompt上累积梯度,显存压力远超推理。

    LongStraw的核心思路是改变训练单元:将共享prompt评估一次为可重用的驻留状态,然后只回放实际学习的响应分支,累积梯度并执行一次分布式更新。

    实测规模

    | 硬件配置 | 模型 | 训练上下文长度 |
    |---------|------|-------------|
    | 8×H20 | Qwen3.6-27B | 2.1M Token GRPO执行 |
    | 8×H20 | 驻留前缀路径 | 4.46M Token |
    | 32×H20 | GLM-5.2(78层MLA/DSA + 256专家MoE) | 2.1M Token 全模型训练 |

    论文和代码已开源:LongStraw论文 | LongStraw代码

    六、递归自我改进:AI教自己变强

    Macaron V1的后训练流程基于MindForge框架实现递归自我改进(RSI),这是一个三阶段闭环:

    1. Discovery(发现)


    从种子任务出发,模型自己构造更难、更多样的任务,验证答案,并按质量、难度和学习价值过滤。

    2. Expansion(扩展)


    模型解决选定任务,审计生成的轨迹,并迭代改进存储在HCP文件中的Harness配置,直到收益递减。

    3. Update(更新)


    优化后的轨迹和HCP配置用于训练和更新模型参数。

    更新后的模型可以生成更具挑战性的任务并进一步改进其Harness,循环往复,不断扩展能力边界。

    关键创新:HCP(Harness Context Protocol) 标准化了Agent会话配置——包括AGENTS.md文件、skills、hooks、系统指令和模型提供商配置——统一为一个一致的格式。训练和生产使用相同的HCP schema,确保模型在训练中观察到的一切在生产环境中也可用。

    七、UI4A:代码原生的生成式UI

    Macaron V1引入了UI4A——一套代码原生的Generative UI解决方案。

    不同于传统方案需要预定义组件模板,UI4A让模型直接编写原生HTML,并可以从NPM注册表或任意URL导入库和组件,即时交付丰富的交互内容。

    UI4A设计为即使未经专门微调的模型也能使用,这使其成为通用接口层而非Macaron专属能力。但Mind Lab确实对Macaron V1进行了训练,使其界面与人类偏好对齐。

    REPL Harness

    配套的REPL Harness为模型提供持久的Python命名空间,基于ToolProxy模式:

  • save_tool:将工作例程打包为可复用工具

  • promote_tool:跨会话保留已验证的工具
  • 工具遵循受控生命周期:组合 → 验证 → 提升 → 复用,只有验证通过的例程才会被提升。

    八、商业化:两周ARR破千万美元

    技术再强,最终要靠商业化说话。

    | 里程碑 | 时间 | 详情 |
    |--------|------|------|
    | Mind Lab成立 | 2025年10月 | 创始人Andrew Chen |
    | FireAct论文 | 2023年 | 与腾讯首席AI科学家姚顺雨联合发表 |
    | Macaron-V1-Preview | 2026年6月 | 引入MoL架构 |
    | 累计融资 | 2026年6月 | 近5000万美元(美团、元禾璞华等投资) |
    | Macaron-V1正式版 | 2026年7月21日 | 全平台开源+API上线 |
    | ARR突破千万美元 | 商业化两周后 | 行业第一梯队 |

    九、如何使用

    开放权重

    所有变体在Hugging Face开放发布:

  • Macaron-V1 Collection
  • 官方API


  • 海外用户:https://mint.macaron.im

  • 中国大陆用户:https://mintcn.macaron.xin
  • Macaron Artifacts插件

    在Claude Code会话中安装UI4A可视化插件:

    bash
    /plugin marketplace add https://github.com/MindLab-Research/macaron-artifacts
    /plugin install macaron@macaron

    安装后在会话中输入 /macaron:macaron 即可打开。

    十、行业影响:持续学习成下一代模型核心能力

    Macaron V1的发布,恰好踩中了一个行业共识:下一代模型必须具备持续学习能力。

    DeepSeek创始人梁文锋将AGI路线比作爬楼梯——去年的阶梯是CoT(思维链),今年的阶梯是Agent,再之后就是持续学习。模型可以完成人类能做的所有事情,包括自己开发更前沿的AI模型,AI加速AI的研究。

    谁在押注这条路线?

    | 玩家 | 定位 | 能力 |
    |------|------|------|
    | Mind Lab | 全链路闭环 | 全球唯二能同时开机数百个万亿参数大模型RL训练 |
    | Thinking Machines Lab | 同路线 | 前OpenAI CTO Mira Murati创办,押注LoRA |
    | Fireworks AI | 基座+LoRA托管 | 一个基座上托管数百个LoRA,动态选择适配器 |
    | Together AI | LoRA默认化 | 已将LoRA设为默认微调方式 |

    为什么只有少数团队跑通?

    这条技术路线的全链路门槛极高:

  • 大模型RL工程

  • 稀疏MoE优化

  • 海量适配器调度

  • 长时序训练

  • Agent系统一体化搭建
  • 每一环都需要复合型人才和长年技术积累。Mind Lab从2023年的FireAct论文到2026年的Macaron V1,走了三年。

    十一、总结

    Macaron V1的发布标志着一个重要转变:AI模型的价值不再只取决于参数规模,而取决于它能否持续学习、能否个性化、能否与用户共同成长。

    Mind Lab的愿景很清晰:让强大的基础模型支持数以百万计的持久个人助手。每个用户拥有自己的LoRA适配器——承载个人偏好、技能、工具使用习惯和记忆——共享同一个万亿参数基座,互不干扰。

    未来AI落地,可能不会只有一个万能大模型,而是无数依附共享基座、拥有独立记忆与能力的个性化智能体共生。

    Macaron V1,就是这个未来的一次预演。


    参考来源:Mind Lab官方发布 | 智东西报道 | Hugging Face模型集合

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!