从0训练一个"能听能说能看"的模型:MiniMind-O与微软174个Skill体系
从0训练一个”能听能说能看”的模型:MiniMind-O与微软174个Skill体系
大模型的世界,有两个极端有趣的方向:
一个在做极致的端到端——让一个小到可以跑在个人电脑上的模型,同时具备听、说、看的能力。
另一个在做极致的上下文激活——让AI编程助手通过正确的”钥匙”激活权重里已有的知识。
今天介绍两个看似不同、实则互补的方向。
1. MiniMind-O:从0训练0.1B全模态Omni模型
GitHub: https://github.com/jingyaogong/minimind-o[1] 论文: https://arxiv.org/abs/2605.03937[2] 标签: MiniMind · 语音模型 · Omni模型 · 0.1B · 从0训练
它是什么
MiniMind-O 是从0完整实现的一个端到端全模态Omni模型,仅约0.1B参数(1.15亿参数),普通个人GPU(RTX 3090)即可完成训练,CPU即可快速推理。
这是当前公开模型中规模最小的完整Omni实现之一。
能做什么
一个模型,同时支持:
| 输入模态 | 输出能力 |
|---|---|
| 文本 | 文本 |
| 语音 | 流式语音 |
| 图片 | 文本 |
也就是说:能听、能看、能思考、能说。
技术亮点
Thinker-Talker双路径架构:
Thinker(思考者):接收文本/语音/图像输入,理解并生成文本内容
Talker(说话者):将文本转换为流式语音输出
关键技术选择:
语音编解码器:Mimi(8层codebook,12.5 Hz,24 kHz)
语音编码器:SenseVoice-Small(冻结)
视觉编码器:SigLIP2(冻结)
语音/视觉特征通过两层MLP projector注入MiniMind隐空间
MTP(Multi-Token Prediction):
Talker采用MTP一次预测多层Mimi codes,支持24 kHz流式语音生成与barge-in打断,实现实时近似双工交互。
训练与推理
| 模式 | 数据量 | 单卡3090耗时 |
|---|---|---|
| mini | 快速入门 | ~2小时 |
| full | 完整权重 | 与发布权重对应 |
全部开源:
模型权重
训练数据
技术报告
完整PyTorch实现代码
适合谁
想从第一行代码读懂大模型原理的学习者
想低成本训练/微调Omni模型的开发者
对端到端多模态模型感兴趣的研究者
2. 微软174个Skill:AI编程的上下文革命
GitHub: https://github.com/microsoft/skills[3] 官网: https://agentskills.io/home[4] 标签: 微软 · AgentSkills · AI编程 · 上下文驱动 · Copilot · Azure
它是什么
微软发布了一套174个Agent Skills,用于AI编程助手(主要是Azure AI Agent Service和GitHub Copilot)。
核心理念:**AI编程助手的知识早已在权重里了,174个Skill只是正确的”激活钥匙”**。
什么是Skill
Skill是一种技能定义规范,用yaml/json描述:
技能的用途
何时使用
如何使用
依赖的API/工具
当AI在合适的时机激活正确的Skill,就像给LLM装上了正确的”触发器”,让它能精准调用权重里已有的知识。
为什么重要
传统LLM编程的问题:
知道怎么做,但不知道什么时候用
知识在权重里,但没有正确激活
Skill的价值:
把”知识”和”触发条件”解耦
让AI在正确的上下文下做正确的事
减少幻觉,提高准确性
生态现状
微软Skill生态野蛮生长中:
官方维护的Skill
社区贡献的Skill
企业自建的私有Skill
风险也随之而来:Skill质量参差不齐,需要有规范的管理机制。
适合谁
Azure AI Agent Service用户
GitHub Copilot深度用户
想建立企业级AI编程规范的企业
3. Oh My codeX(OMX):Codex CLI的多智能体编排层
GitHub: https://github.com/Yeachan-Heo/oh-my-codex[5] 文档: https://yeachan-heo.github.io/oh-my-codex-website/[6] 标签: Codex · 多智能体 · 工作流编排 · Hooks
它是什么
OMX 是OpenAI Codex CLI的工作流增强层,在Codex之上加了hooks、团队协作、工作流自动化。
核心能力
标准化工作流:
$deep-interview:澄清需求$ralplan:制定并评审计划$ralph:执行计划直到完成$team:多Agent并行执行
工作流程:
启动Codex → 需求澄清 → 计划评审 → 执行或团队并行 → 完成
保持项目状态:
.omx/目录保存项目指导、计划、日志、状态
跨会话保持上下文
适合谁
OpenAI Codex CLI用户想提升效率
需要多智能体协作的开发场景
想建立标准化AI编程工作流的团队
总结
| 方向 | 工具 | 核心价值 |
|---|---|---|
| 端到端多模态训练 | MiniMind-O | 从0训练0.1B全模态模型 |
| 上下文激活 | 微软174个Skill | 用Skill激活LLM权重知识 |
| 多智能体编排 | Oh My codeX | Codex的工作流增强层 |
这三个方向代表了大模型发展的不同思路:有人追求更小更强,有人追求正确激活,有人追求协同工作。它们的共同点:让大模型真正好用,真正实用。
本文来源:稍后阅读清单深度调研 · 小欧整理
引用链接
[1]https://github.com/jingyaogong/minimind-o
[2]https://arxiv.org/abs/2605.03937
[3]https://github.com/microsoft/skills
[4]https://agentskills.io/home