当前位置:首页 > DeepSeek技术交流 > 正文内容

DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?

8个月前 (02-26)DeepSeek技术交流601

一开始,我还以为 DeepSeek 会走传统路线,比如大厂常见的蒸馏技术,搞个小参数的 Flash 模型。毕竟这种方法能有效降低计算需求,但缺点也很明显,就是小模型再怎么优化,和大模型比起来,性能还是会有损失 结果 DeepSeek 完全没按套路出牌,它不是去压缩模型,而是换了个角度,直接假设未来算力足够,然后想办法更高效地用好现有显卡架构。换句话说,不是缩小参数规模,而是在同等规模下优化计算方式,让计算更具性价比 这种思路比纯工程优化要“硬核”得多。一般来说,搞小模型是比较务实的工程方案,但 DeepGEMM 这种技术驱动的做法更有延展性。它不仅和小模型方法兼容,而且即使以后显卡更强、模型规模更大,这套技术依然能继续用,不会过时

“DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?” 的相关文章

梁文锋参与发表回顾性论文:DeepSeek首次揭秘V3模型背后扩展方案

梁文锋参与发表回顾性论文:DeepSeek首次揭秘V3模型背后扩展方案

DeepSeek刚刚发表了一篇名为《深入解读 DeepSeek-V3:AI 架构的扩展挑战与硬件思考》(Insights into DeepSeek-V3: Scaling Challenges an...

DeepSeek新专利“一种广度数据采集的方法及其系统”公布,可减少数据采集时网络资源消耗

DeepSeek新专利“一种广度数据采集的方法及其系统”公布,可减少数据采集时网络资源消耗

国家知识产权局官网显示,4月1日,DeepSeek关联公司杭州深度求索人工智能基础技术研究有限公司申请的“一种广度数据采集的方法及其系统”专利公布。摘要显示,本发明涉及数据采集领域,尤其涉及一种广度数...

DeepSeek:改变行业格局的技术革命-DeepSeek的未来前景

DeepSeek:改变行业格局的技术革命-DeepSeek的未来前景

标题:DeepSeek:改变行业格局的技术革命关键词:DeepSeek,人工智能,数据分析,技术创新,行业应用,智能化描述:深度探索DeepSeek的广泛应用,如何在各个行业中带来创新和效率的飞跃,提...

中国信通院:启动DeepSeek国产化适配测试工作

中国信通院:启动DeepSeek国产化适配测试工作

中新网北京2月14日电(记者 宋宇晟)近期,DeepSeek陆续开源V3、R1系列高性能、低成本模型,人工智能软硬件协同创新重要性进一步凸显。记者从中国信息通信研究院(简称“中国信通院”)获悉,Dee...

法律服务平台+DeepSeek!AI引领法律服务全面升级——大安市司法局打造智慧司法新标杆

法律服务平台+DeepSeek!AI引领法律服务全面升级——大安市司法局打造智慧司法新标杆

为满足群众日益增长的法治服务需求,大安市司法局率先引入DeepSeek人工智能技术,全面革新公共法律服务、普法宣传、人民调解等核心业务,推出公共法律服务掌上平台覆盖线上、公共法律服务智能终端覆盖线下,...

爆火的DeepSeek,普通人怎么用?一看就会→

爆火的DeepSeek,普通人怎么用?一看就会→

近日国产AI DeepSeek在中国、美国的科技圈受到广泛关注还被称为“神秘的东方力量”DeepSeek超越了ChatGPT,登顶苹果手机应用商店美国区免费应用榜单。它的访问使用量急速上升,已经成为目...