Skip to content

Latest commit

 

History

44 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

个人主页

我是张一凡,海光信息客户应用优化部成员, 欢迎来到我的github主页,本人专注于 国产海光芯片(DCU)生态下的大模型与具身智能性能优化。这个站点是我的工作成果归档:每个项目包含优化思路、性能数据与代码。


一、大模型训练与推理优化

# 项目 类型 关键词
01 DeepSeek-V3 671B 千卡集群训练 训练 ✅基于DCU-Megatron的千卡集群训练 线性度计算 集群通信
02 Qwen3.5-0.8B 训练优化 训练 ✅基于deepspeed的训练优化 吞吐提升近4倍 引入fla
03 Qwen3.5-35B 强化学习适配 训练 ✅基于verl+megatron+grpo的单机8卡强化学习性能跑通
04 Qwen3-30B 训练优化 训练 ✅ 基于megatron-sft的多机训练优化任务 性能翻倍
05 Qwen3.6-27B 多模态推理优化 推理 ✅ 基于vllm0.21的推理任务优化 性能提升3倍以上
06 Qwen3-VL-Embedding 推理优化 推理 ✅解决高并发时性能劣化问题
07 DeepSeek-V4-Flash 推理优化 推理 ✅ 三大瓶颈定位 多种并行方式寻优
08 DeepSeek-V4-Pro / GLM5.2 推理部署 推理 ✅指定缓存命中率并基于PD分离/PD分离的性能压测
09 讯飞自研模型适配及优化 推理 ✅ 客户闭源模型的适配+优化

二、具身智能模型优化

# 项目 优化效果
10 DreamZero-DCU ✅ 性能提升32%
11 Isaac-GR00T-DCU ✅ 性能提升42%
12 LeRobot-ACT-DCU ✅ 性能提升30%
13 LingBot-VA-DCU ✅ 性能提升28%
14 LingBot-VLA-DCU ✅ 性能提升52%
15 Cosmos3-Nano-DCU ✅ 性能提升37%
16 OpenPI-DCU ✅ 性能提升26%

能力标签

  • 训练优化:Megatron / DeepSpeed / FSDP / ddp / verl, prof 抓取与算子级分析, 框架与 Attention 选型, 模型框架层行为优化
  • 推理优化:vLLM / SGLang, PD分离 / IFB / Mooncake 部署,模型量化,kv-cache量化/固定缓存命中压测
  • 集群任务:多机通信 / K8s / Ray / mp / Clusconf / mpirun /等多机任务启动 基础硬件故障识别

欢迎提出任何宝贵意见!

About

No description, website, or topics provided.

Resources

Stars

2 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages