必威手机登录在线官网-一呼百应

推荐
快报
广场
科股宝VIP
视频
直播

DeepSeek推出NSA，用于超快速的长上下文训练和推理

2025.02.18 16:36

钛媒体App 2月18日消息，DeepSeek称，NSA是一种与硬件一致且本机可训练的稀疏注意力机制，用于超快速的长上下文训练和推理。通过针对现代硬件的优化设计，NSA加快了推理速度，同时降低了预训练成本，而不会影响性能。在一般基准测试、长上下文任务和基于指令的推理上，它的表现与完全注意力模型相当甚至更好。

AGI

本文内容仅供参考，不构成投资建议，请谨慎对待。

0 / 300

根据《网络安全法》实名制要求，请绑定手机号后发表评论

请登录后输入评论内容

OCO
这意思是训练的机器成本再降低一点？普通机器也能玩？
回复 2月18日 · via iphone

投资日历