一、总览
DeepSeek V4 Flash 正式版现已正式开源。其模型结构与此前发布的版本保持一致,KTransformers(KT)提供原生无损支持,精度完全对齐。用户下载模型即可直接运行。
二、性能表现
借助消费级 GPU 与 CPU,用户即可流畅体验前沿大模型能力。经测试,在双卡 RTX 5090 与支持 AVX512 指令集的 CPU 上,KT 的预填充速度可达 1000+ tok/s,同时解码速度可达 30+ tok/s。
详情请参考 KTransformers 性能测试: https://ktransformers.net/zh/benchmarks
三、支持硬件
目前,KT 已覆盖主流消费级硬件平台:
-
支持 NVIDIA GeForce RTX 30、40、50 系列显卡
-
支持 AVX2、AVX-512 指令集
-
支持单卡与多卡配置
运行需要配备不少于 200 GB 的系统内存。
四、快速部署
为降低部署门槛,KT 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。
4.1 拉取 Docker 镜像
拉取镜像, 标签需对齐 Docker Hub 上 approachingai/ktransformers (https://hub.docker.com/r/approachingai/ktransformers) 仓库的 DSV4-specific:
sudo docker pull approachingai/ktransformers:DSV4-specific
4.2 启动服务
下载模型后进入模型目录:
cd /path/to/DeepSeek-V4-Flash-0731
执行以下命令启动服务:
sudo docker run --gpus all--ipc host--cap-add SYS_NICE-p 30000:30000-v "$PWD":/model:roapproachingai/ktransformers:DSV4-specific
服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。服务日志出现就绪信息后,可用以下命令确认接口可达:
curl http://localhost:30000/v1/models
如果需要了解更加详细的调优方式,或是希望从本地编译源码部署,参见 KTransformers tutorial:https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/DeepSeek-V4-Flash.md
关于 KVCache.AI
KVCache.AI 是一个专注于大模型基础设施与推理优化的开放组织。我们通过开源项目、系统实践和学术研究,持续提升大模型部署与服务效率,降低部署成本与复杂度,让更多团队能够用得起、用得好大模型基础设施。我们的开源项目包括 Mooncake、KTransformers 和 AgentENV。





