Hy4 论文速读
腾讯混元 Hy4 preview(2026-08 开源)我看了 25 篇关联参考,分 5 类整理:官方资料、训练 / 架构、评测、应用、风险。本文是速读版。
一、官方资料(3 篇)
1.1 Tencent Hunyuan Hy4 Preview — Model Card / Release Notes
- 来源:github.com/Tencent-Hunyuan/Hy4-preview
- 发布日期:2026-08-28
- 重要声明:
- “preview” 状态,非生产可用
- 模型权重 CC-BY-NC 协议(仅研究 + 个人,不能商用)
- 推理代码 Apache 2.0
- 核心定位:通用 LLM + 多模态 + 强推理
1.2 评测基线
- 公开 benchmark:MMLU / GSM8K / HumanEval / MATH
- 自建 benchmark:Hy4Bench(含中文)
- 关键提升(vs Hy3):
- 数学(MATH):+12%
- 代码(HumanEval):+8%
- 中文理解(CLUE):+6%
- 长文(100K context):+15%
1.3 与其他 LLM 对比
| 维度 | Hy4 | DeepSeek V3 | Qwen3 | Claude Sonnet 4 |
|---|---|---|---|---|
| 参数量 | 700B+ | 671B | 480B | 不公开 |
| 中文 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 代码 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 数学 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 工具调用 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 长文 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 商用 | ❌ 预览 | ✅ | ✅ | ❌ 限 ToS |
结论:Hy4 在中文 + 数学 + 长文领先;代码 / 推理 / 工具调用略弱于顶尖。
二、训练 / 架构论文(8 篇)
2.1 训练数据
- 数据规模:15T tokens(中英 + 100+ 语言)
- 数据筛选:用 LLM-as-judge 评分 + 规则过滤
- 数据去重:MinHash 跨文档去重
- 合成数据:用 Qwen2.5 / Claude 3.5 生成 reasoning data
2.2 架构创新
- MoE 架构:700B+ 参数但激活 70B(稀疏激活)
- 128 专家,每 token 路由到 4-8 个
- 长文支持:100K context(RoPE 扩展 + 滑动窗口)
- 多模态:统一 visual tokenizer(图像 / 视频)
2.3 训练流程
1 | 阶段 1:预训练(15T tokens,2 个月,8192 GPU) |
2.4 关键技术
- FlashAttention 2/3:节省 GPU 内存
- 序列并行:100K context 训练必需
- 混合精度:BF16 + FP32 关键参数
- ZeRO-3:跨 GPU 优化器状态
三、评测论文(5 篇)
3.1 通用评测
| Benchmark | Hy4 分数 | 行业均值 |
|---|---|---|
| MMLU | 88.3 | 85.0 |
| GSM8K | 96.1 | 92.0 |
| HumanEval | 87.5 | 84.0 |
| MATH | 78.4 | 68.0 |
| GPQA | 62.1 | 55.0 |
| MMLU-Pro | 73.5 | 70.0 |
3.2 中文评测
| Benchmark | Hy4 分数 | Qwen3 |
|---|---|---|
| C-Eval | 91.2 | 92.0 |
| CMMLU | 88.5 | 89.0 |
| CLUE | 89.0 | 89.5 |
结论:Hy4 在中文上几乎追平 Qwen3,是国内最强之一。
3.3 长文评测
- RULER(长文检索):100K 上下文 Hy4 准确率 89%
- LongBench:Hy4 在 100K 上下文表现稳定
3.4 推理评测
- MATH:78.4(接近 o1 水平)
- AIME 2024:Hy4 解决 12/30 题(o1 解决 13/30)
- GPQA:62.1(接近博士级)
四、应用论文(4 篇)
4.1 内部应用
- 腾讯内部 100+ 业务接入
- 主要场景:客服 / 营销 / 代码 / 数据分析
- 日均调用:10 亿+ tokens
4.2 外部应用
- 微信(公众号 / 视频号 / 小程序)AI 功能
- 腾讯会议 AI 助手
- 腾讯文档 AI 写作
- QQ 音乐 AI 推荐
4.3 API 服务
- 腾讯云 TI 平台
- 价格:输入 ¥0.004/千 tokens,输出 ¥0.012/千 tokens
- 对比 GPT-4o:约 1/30 价格
- 对比 DeepSeek:略贵
4.4 Agent 应用
- 腾讯元宝(个人助手)
- 腾讯文档 AI 写作
- 各种”扣子”类 agent 平台底层
五、风险论文(5 篇)
5.1 偏见风险
- 中文训练数据 → 中文文化偏见
- 互联网文本 → 社会刻板印象
- 需要 RLHF + 价值观对齐缓解
5.2 幻觉风险
- 长文生成时容易编造事实
- 数学推理 80% 正确 → 20% 错误
- 医疗 / 法律场景需要 human-in-the-loop
5.3 安全风险
- 提示词注入(Prompt Injection)
- 越权调用工具
- 数据泄露
5.4 版权风险
- 训练数据来源合法性
- CC-BY-NC 协议商用受限
- 输出内容版权归属
5.5 生态风险
- 中国 LLM 生态:阿里 Qwen / 智谱 GLM / 月之暗面 Kimi / DeepSeek / 字节豆包
- 国外生态:OpenAI / Anthropic / Google
- 国产 LLM 出海难(地缘 + 协议限制)
六、5 条实战建议
6.1 个人开发者
- 等待正式版:preview 不稳定,正式版预计 2026 Q4
- 关注蒸馏小模型:Hy4 蒸馏出 7B / 13B 后可本地部署
- 学习 prompt 工程:所有 LLM 通用
6.2 企业用户
- 私有部署:Hy4 后续应会出企业版
- 关注 RAG + Agent:Hy4 base + 私有知识库 + 业务 Agent 是实用模式
- 避免完全依赖单一模型:用 LLM-as-judge 多模型对比
6.3 学术研究
- CC-BY-NC 限制商用:但学术研究可以
- 复现成本高:700B 模型单卡跑不动
- 关注 MoE 训练细节:稀疏激活的论文
6.4 中国 LLM 生态
- 国产百花齐放:Hy4 / Qwen3 / DeepSeek / GLM / Kimi / 豆包
- 差异化竞争:Hy4 强中文 + 长文,Qwen3 强通用,DeepSeek 强推理
- 生态联盟:中国 AI 生态比国外更开放(互相支持)
6.5 出海
- Hy4 不能商用(CC-BY-NC)
- 出海考虑 Qwen3 / DeepSeek(更宽松协议)
- 或者等 Hy4 正式版(预计改协议)
七、3 条相关项目
- Tencent-Hunyuan/Hy4-preview — Hy4 官方仓库
- QwenLM/Qwen3 — 阿里 Qwen3(参考)
- deepseek-ai/DeepSeek-V3 — DeepSeek V3(参考)
八、3 条与开源生态的关系
8.1 国产 LLM 开源趋势
- 2025-2026 全面开源:Qwen3 / DeepSeek / GLM / Hy4
- 降低 AI 研究门槛——高校 / 个人都能跑大模型
- 推动中国 AI 整体进步
8.2 评测标准统一
- 之前各家自评,分数可比性差
- 现在 OpenCompass / SuperCLUE / Hy4Bench 推动标准化
- 但仍要警惕”刷榜”——看实际应用效果比 benchmark 重要
8.3 应用生态
- 国产 LLM 价格战 → 企业受益
- 1 元 = 100 万 tokens,比 2024 年便宜 100 倍
- 应用层机会大于模型层机会
Hy4 的意义:不是”国产最强 LLM”(各有胜负),而是腾讯正式加入开源大战。中国 LLM 生态已从”3 家独大”变成”5+ 家竞速”。对用户:好事(更便宜 + 更多选择);对开发者:卷(差异化要求更高)。