DeepSeek V4 Flash 正式版开源,KTransformers 原生支持

一、总览

DeepSeek V4 Flash 正式版现已正式开源。其模型结构与此前发布的版本保持一致,KTransformers(KT)提供原生无损支持,精度完全对齐。用户下载模型即可直接运行。

 二、性能表现

借助消费级 GPU 与 CPU,用户即可流畅体验前沿大模型能力。经测试,在双卡 RTX 5090 与支持 AVX512 指令集的 CPU 上,KT 的预填充速度可达 1000+ tok/s,同时解码速度可达 30+ tok/s。

详情请参考 KTransformers 性能测试: https://ktransformers.net/zh/benchmarks

三、支持硬件

目前,KT 已覆盖主流消费级硬件平台:

  • 支持 NVIDIA GeForce RTX 30、40、50 系列显卡

  • 支持 AVX2、AVX-512 指令集

  • 支持单卡与多卡配置

运行需要配备不少于 200 GB 的系统内存

四、快速部署

为降低部署门槛,KT 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。

4.1 拉取 Docker 镜像

拉取镜像, 标签需对齐 Docker Hub 上 approachingai/ktransformers (https://hub.docker.com/r/approachingai/ktransformers) 仓库的 DSV4-specific

sudo docker pull approachingai/ktransformers:DSV4-specific

4.2 启动服务

下载模型后进入模型目录:

cd /path/to/DeepSeek-V4-Flash-0731

执行以下命令启动服务:

sudo docker run --gpus all   --ipc host   --cap-add SYS_NICE   -p 30000:30000   -v "$PWD":/model:ro   approachingai/ktransformers:DSV4-specific

服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。服务日志出现就绪信息后,可用以下命令确认接口可达:

curl http://localhost:30000/v1/models

如果需要了解更加详细的调优方式,或是希望从本地编译源码部署,参见 KTransformers tutorial:https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/DeepSeek-V4-Flash.md

关于 KVCache.AI

KVCache.AI 是一个专注于大模型基础设施与推理优化的开放组织。我们通过开源项目、系统实践和学术研究,持续提升大模型部署与服务效率,降低部署成本与复杂度,让更多团队能够用得起、用得好大模型基础设施。我们的开源项目包括 Mooncake、KTransformers 和 AgentENV。

© 版权声明
THE END
喜欢就支持一下吧
点赞246 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片