|
|
||
|---|---|---|
| docs | ||
| README.md | ||
README.md
生成式 AI 高效部署实践——基于超大模型的推理和部署实践
1. 课程概述
本课程基于腾讯混元大模型平台的一线实践经验,系统介绍生成式 AI 大模型从训练到推理部署的全链路技术方案。内容涵盖混元大模型与太极一站式平台的整体架构、Angle HCF 推理加速框架的核心技术、Angle SNIP 模型压缩框架的多种压缩算法,以及业务落地场景与前景展望。
课程源自 CNCC 2023 技术分享,由腾讯混元大模型团队出品,聚焦大模型在生产环境中的工程化部署挑战与实践经验。
2. 学习目标
通过本课程的学习,您将:
- 了解腾讯混元大模型及太极一站式平台的架构与能力
- 掌握大模型推理加速的核心技术(Attention 优化、显存优化、服务化调度等)
- 理解模型压缩的关键方法(量化压缩、稀疏压缩、蒸馏、小型化)
- 了解生成式 AI 技术在腾讯内部标杆业务中的落地场景
3. 适合的学习者
- 对大规模语言模型(LLM)推理部署感兴趣的技术人员
- 希望了解大模型工程化落地的算法工程师与系统工程师
- 高校计算机相关专业的研究生与高年级本科生
- AI 平台架构师与云服务开发者
4. 课程结构
| 章节 | 章节名称 | 主要内容 | 学习目标 |
|---|---|---|---|
| 1 | 混元大模型 & 太极一站式平台 | 混元大模型概述、太极平台架构、加速组件 | 了解混元大模型与太极一站式平台的整体架构 |
| 2 | 太极 Angle HCF 推理加速框架 | Attention 加速、显存优化、量化与稀疏压缩适配、服务化调度 | 掌握大模型推理加速的核心技术原理 |
| 3 | 太极 Angle SNIP 模型压缩框架 | 量化压缩、稀疏压缩、小型化蒸馏、步数蒸馏 | 理解模型压缩的主流方法与效果评估 |
| 4 | 业务落地及前景展望 | 腾讯文档/会议/广告等落地场景、技术展望 | 了解生成式 AI 落地实践与未来方向 |
5. 实操演练
本课程秉持"做中学 (Learning by Doing)"原则,建议学习者在学习过程中:
- 结合章节内容,尝试在云环境中部署大模型推理服务
- 使用开源工具(如 TensorRT-LLM、vLLM、Triton Inference Server)复现推理加速实验
- 对比不同量化精度(FP16/INT8/INT4)对模型性能和推理速度的影响
- 探索稀疏压缩和蒸馏技术在大模型上的应用效果
6. 课程打卡指引
本项目采用 Issue 评论打卡 的方式。完成每项任务后,在对应 Issue 下提交您的学习成果。
打卡任务列表
| 任务 | 名称 | 说明 |
|---|---|---|
| 任务1 | 📖 第1章学习打卡 | 掌握混元大模型与太极平台架构 |
| 任务2 | 📖 第2章学习打卡 | 理解 Angle HCF 推理加速原理 |
| 任务3 | 📖 第3章学习打卡 | 掌握 Angle SNIP 模型压缩方法 |
| 任务4 | 📖 第4章学习打卡 | 了解生成式 AI 业务落地场景 |
7. 共创与贡献
欢迎所有学习者参与贡献!
贡献方式:
- 提交 Issue 反馈问题或建议
- 提交 Pull Request 完善内容
- 分享您的学习经验
8. 许可说明
本课程暂无指定许可证。课程创建者可后续添加 LICENSE 文件。
推荐许可证选项:MIT / Apache 2.0 / CC BY-SA 4.0 / MulanPSL-2.0