数据资产全过程管理:解锁DeepSeek智能引擎
时间:2025-02-12
作者:林建兴
混合专家(MoE)架构 DeepSeek-V3拥有6710亿参数,但在实际运行中,每个输入仅激活370亿参数,这种选择性激活的方式大大降低了计算成本,同时保持了高性能 高效的训练框架 采用HAI-LLM框架,支持16-wayPipeline Parallelism(PP)、64-wayExpert Parallelism(EP)和ZeRO-1Data Parallelism(DP),并通过多种优化手段降低了训练成本 多头潜在注意力(MLA) 该架构在DeepSeek-V2中已经得到验证,能够实现高效的训练和推理 多tokens预测训练目标 该策略提升了模型的整体性能 无辅助损失的负载平衡策略 这一策略旨在最小化因负载平衡对模型性能产生的负面影响