Text Generation
Transformers
Safetensors
deepseek_v4
conversational
Eval Results
8-bit precision
fp8
Instructions to use deepseek-ai/DeepSeek-V4-Pro with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use deepseek-ai/DeepSeek-V4-Pro with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Pro") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Pro") model = AutoModelForCausalLM.from_pretrained("deepseek-ai/DeepSeek-V4-Pro", device_map="auto") - Inference
- HuggingChat
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use deepseek-ai/DeepSeek-V4-Pro with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "deepseek-ai/DeepSeek-V4-Pro" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "deepseek-ai/DeepSeek-V4-Pro", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/deepseek-ai/DeepSeek-V4-Pro
- SGLang
How to use deepseek-ai/DeepSeek-V4-Pro with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "deepseek-ai/DeepSeek-V4-Pro" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "deepseek-ai/DeepSeek-V4-Pro", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "deepseek-ai/DeepSeek-V4-Pro" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "deepseek-ai/DeepSeek-V4-Pro", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use deepseek-ai/DeepSeek-V4-Pro with Docker Model Runner:
docker model run hf.co/deepseek-ai/DeepSeek-V4-Pro
知识截止时效性建议:模型需更紧密跟进开源生态动态
#185
by xbb19730559 - opened
作为一个日常重度使用 DeepSeek API(Pro 模型)的开发者,想提一个务实的建议:
今天用 Pro 模型在 Mac Studio (256GB) 上部署 DeepSeek V4 Flash 本地推理,全过程暴露了模型知识截止后的严重断层:
- 不知道 antirez (Redis 创始人) 在 HuggingFace 上发布了专门针对 Mac 的 GGUF 量化版(antirez/deepseek-v4-gguf,IQ2XXS 80GB),已获 26 万+ 下载
- 不知道他的 llama.cpp-deepseek-v4-flash 分支和 ds4 推理引擎已在 GitHub 开源
- 不知道 MLX 社区版(mlx-community)对 DSV4 的支持仍是实验阶段
- 建议用 ModelScope 国内源下载,但没验证该模型是否存在于 ModelScope 上
这些信息在 HuggingFace / GitHub / Discord 上是实时更新的,但模型完全不知道。
建议:
- 训练数据的时效性窗口能否缩短?特别是 GitHub trending、HuggingFace 热门模型/讨论区等开源生态信息
- 或者在推理时增加实时检索开源社区最新动态的能力(类似 Search 增强)
- 模型对"已有成功方案"的遗忘问题——社区已有成熟部署方案(antirez 的 Mac GGUF),但模型不知道,导致反复推荐不可行路径
不是投诉,是希望 DeepSeek 越来越好的建设性反馈。感谢团队的优秀工作!
朋友,模型完成训练后权重就固定了,训练截止日期后一切知识天然是不知道的;其次重复训练成本很高,用于解决知识实时性问题性价比过低,一般需要互联网检索解决;另外实时检索没法靠模型权重实现的,需要通过外部工具调用来实现。其实你的诉求通过本地部署的模型再搭配上网络检索的agent工具就能解决。
这种东西是有必要训练到权重里的吗?加个联网搜索功能不就行了
靠训练补充这些知识性价比很低,你不能接入一个联网搜索工具?