找回密码
 立即注册
查看: 108|回复: 0

[分享]CPU对大语言模型微调的影响 复旦MOSS 16B模型

[复制链接]

1964

主题

5

回帖

1964

积分

金牌会员

积分
1964
发表于 2023-7-23 19:34:53 | 显示全部楼层 |阅读模式
[分享]CPU对大语言模型微调的影响 复旦MOSS 16B模型

表中测试数据1000条,epochs=2







所有测试均使用W9-3495X模拟,微调使用DeepSpeed offload到CPU上,因此对CPU性能有需求


根据测试,12核心、3.20 GHz的w5-3425 与 顶级的W9-3495X对比,实际耗时相差不足10%

然而,6核心、2.1 GHz的w3-2423,与w5-3425和顶级的W9-3495X有着巨大的差距,实际耗时差距在35%以上



这个不是很严谨的测试供大家参考



用时10%的差距能够接受,毕竟w5-3425  0.82万  与   W9-3495X 4.41万的差距在那呢,都快差出个RTX 6000了,把钱用在第二块RTX 6000上明显更合适。

但低端CPU 英特尔® 至强® W3-2423 处理器 就不建议了,虽然便宜,但性能太差;

而w5-3425 比  W3-2423仅仅贵了大约0.5万元,多花0.5万元25%的速度提升还是很可观的。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|翻墙党

GMT+8, 2026-9-29 22:57 , Processed in 0.060691 second(s), 24 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表