DeepInfra logo

DeepInfra

模型整合商

DeepInfra is a serverless inference marketplace running open models (Llama, Qwen, DeepSeek, GLM, Kimi and more) on managed GPUs, billed per token with no idle cost — among the cheapest hosted open-model APIs.

模型
137
提示快取
批次折扣
Tool Calling
模型137
模型輸入價格輸出價格
anthropic/claude-fable-5$10$50
anthropic/claude-haiku-4-5$1$5
anthropic/claude-opus-4-7$5$25
anthropic/claude-opus-4-8$5$25
anthropic/claude-sonnet-4-6$3$15
anthropic/claude-sonnet-5$2$10
BAAI/bge-base-en-v1.5$0.005
BAAI/bge-en-icl$0.01
BAAI/bge-large-en-v1.5$0.01
BAAI/bge-m3$0.01
BAAI/bge-m3-multi$0.01
bosonai/HiggsAudioV2.5$20/百萬字元
ByteDance/Seed-1.8$0.25$2
ByteDance/Seed-2.0-code$0.5$3
ByteDance/Seed-2.0-mini$0.1$0.4
ByteDance/Seed-2.0-pro$0.5$3
ByteDance/Seedance-1.5-Pro$1.2
ByteDance/Seedance-2.0$4.7
canopylabs/orpheus-3b-0.1-ft$7/百萬字元
deepseek-ai/DeepSeek-R1-0528DeepSeek$0.5$2.15
deepseek-ai/DeepSeek-V3DeepSeek$0.32$0.89
deepseek-ai/DeepSeek-V3-0324DeepSeek$0.24$0.9
deepseek-ai/DeepSeek-V3.1DeepSeek$0.25$0.95
deepseek-ai/DeepSeek-V3.1-TerminusDeepSeek$0.27$0.95
deepseek-ai/DeepSeek-V3.2DeepSeek$0.26$0.38
deepseek-ai/DeepSeek-V4-FlashDeepSeek$0.09$0.18
deepseek-ai/DeepSeek-V4-ProDeepSeek$1.3$2.6
google/embeddinggemma-300mGemma$0.002
google/gemini-2.5-flash$0.3$2.5
google/gemini-2.5-pro$1.25$10
google/gemini-3.1-flash-lite$0.25$1.5
google/gemini-3.1-pro$2$12
google/gemini-3.5-flash$1.5$9
google/gemini-3-pro-image$120
google/gemma-3-12b-itGemma$0.05$0.15
google/gemma-3-27b-itGemma$0.08$0.16
google/gemma-3-4b-itGemma$0.05$0.1
google/gemma-4-26B-A4B-itGemma$0.07$0.34
google/gemma-4-31B-itGemma$0.13$0.38
google/gemma-4-31B-it-turboGemma$0.12$0.37
google/gemma-4-E4B-itGemma$0.02$0.1
Gryphe/MythoMax-L2-13b$0.4$0.4
hexgrad/Kokoro-82M$0.62/百萬字元
intfloat/e5-base-v2$0.005
intfloat/e5-large-v2$0.01
intfloat/multilingual-e5-large$0.01
intfloat/multilingual-e5-large-instruct$0.01
inworld-ai/realtime-tts-1.5-max$50/百萬字元
inworld-ai/realtime-tts-1.5-mini$25/百萬字元
inworld-ai/realtime-tts-2$35/百萬字元
meta-llama/Llama-3.3-70B-Instruct-TurboLlama$0.1$0.32
meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8Llama$0.2$0.8
meta-llama/Llama-4-Scout-17B-16E-InstructLlama$0.1$0.3
meta-llama/Llama-Guard-4-12BLlama$0.18$0.18
meta-llama/Meta-Llama-3.1-70B-Instruct-TurboLlama$0.4$0.4
meta-llama/Meta-Llama-3.1-8B-Instruct-TurboLlama$0.02$0.04
microsoft/phi-4Phi$0.07$0.14
MiniMaxAI/MiniMax-M2.7MiniMax$0.25$1
MiniMaxAI/MiniMax-M2.7-TurboMiniMax$0.38$1.7
MiniMaxAI/MiniMax-M3MiniMax$0.3$1.2
mistralai/Mistral-Nemo-Instruct-2407Mistral$0.019$0.03
mistralai/Mistral-Small-24B-Instruct-2501Mistral$0.05$0.08
mistralai/Mistral-Small-3.2-24B-Instruct-2506Mistral$0.075$0.2
moonshotai/Kimi-K2.5Kimi$0.45$2.25
moonshotai/Kimi-K2.6Kimi$0.75$3.5
moonshotai/Kimi-K2.7-CodeKimi$0.74$3.5
NousResearch/Hermes-3-Llama-3.1-405BLlama$1$1
NousResearch/Hermes-3-Llama-3.1-70BLlama$0.7$0.7
nvidia/llama-nemotron-embed-vl-1b-v2Llama$0.01
nvidia/llama-nemotron-rerank-vl-1b-v2Llama$0.01
nvidia/Nemotron-3-Embed-1B-BF16Nemotron$0.015
nvidia/Nemotron-3-Embed-1B-NVFP4Nemotron$0.01
nvidia/Nemotron-3-Embed-8BNemotron$0.035
nvidia/Nemotron-3-Nano-30B-A3BNemotron$0.05$0.2
nvidia/Nemotron-Content-Safety-3.5Nemotron$0.2$0.2
nvidia/NVIDIA-Nemotron-3-Super-120B-A12BNemotron$0.085$0.4
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55BNemotron$0.5$2.2
openai/gpt-oss-120bGPT-OSS$0.037$0.17
openai/gpt-oss-120b-TurboGPT-OSS$0.15$0.6
openai/gpt-oss-20bGPT-OSS$0.03$0.14
Qwen/Qwen2.5-72B-InstructQwen$0.36$0.4
Qwen/Qwen3-14BQwen$0.12$0.24
Qwen/Qwen3-235B-A22B-Instruct-2507Qwen$0.09$0.55
Qwen/Qwen3-235B-A22B-Thinking-2507Qwen$0.23$2.3
Qwen/Qwen3-30B-A3BQwen$0.12$0.5
Qwen/Qwen3-32BQwen$0.08$0.28
Qwen/Qwen3.5-122B-A10BQwen$0.29$2.4
Qwen/Qwen3.5-27BQwen$0.26$2.6
Qwen/Qwen3.5-35B-A3BQwen$0.14$1
Qwen/Qwen3.5-397B-A17BQwen$0.45$3
Qwen/Qwen3.5-9BQwen$0.1$0.15
Qwen/Qwen3.6-27BQwen$0.32$3.2
Qwen/Qwen3.6-35B-A3BQwen$0.15$0.95
Qwen/Qwen3.7-MaxQwen$2.5$7.5
Qwen/Qwen3-Coder-480B-A35B-Instruct-TurboQwen$0.3$1
Qwen/Qwen3-Embedding-0.6BQwen$0.01
Qwen/Qwen3-Embedding-4BQwen$0.02
Qwen/Qwen3-Embedding-8BQwen$0.01
Qwen/Qwen3-MaxQwen$1.2$6
Qwen/Qwen3-Max-ThinkingQwen$1.2$6
Qwen/Qwen3-Next-80B-A3B-InstructQwen$0.09$1.1
Qwen/Qwen3-Reranker-0.6BQwen$0.01
Qwen/Qwen3-Reranker-4BQwen$0.025
Qwen/Qwen3-Reranker-8BQwen$0.05
Qwen/Qwen3-TTSQwen$20/百萬字元
Qwen/Qwen3-TTS-VoiceDesignQwen$20/百萬字元
Qwen/Qwen3-VL-235B-A22B-InstructQwen$0.2$0.88
Qwen/Qwen3-VL-30B-A3B-InstructQwen$0.15$0.6
ResembleAI/chatterbox-multilingual$1/百萬字元
ResembleAI/chatterbox-turbo$1/百萬字元
Sao10K/L3.1-70B-Euryale-v2.2$0.85$0.85
Sao10K/L3-8B-Lunaris-v1-Turbo$0.04$0.05
sentence-transformers/all-MiniLM-L12-v2$0.005
sentence-transformers/all-MiniLM-L6-v2$0.005
sentence-transformers/all-mpnet-base-v2$0.005
sentence-transformers/clip-ViT-B-32$0.005
sentence-transformers/clip-ViT-B-32-multilingual-v1$0.005
sentence-transformers/multi-qa-mpnet-base-dot-v1$0.005
sentence-transformers/paraphrase-MiniLM-L6-v2$0.005
sesame/csm-1b$7/百萬字元
shibing624/text2vec-base-chinese$0.005
stepfun-ai/Step-3.7-Flash$0.2$1.15
tencent/Hy3$0.14$0.58
thenlper/gte-base$0.005
thenlper/gte-large$0.01
thinkingmachines/Inkling$1$4.05
XiaomiMiMo/MiMo-V2.5$0.4$2
XiaomiMiMo/MiMo-V2.5-Pro$1$3
XiaomiMiMo/MiMo-V2.5-ttsFree/百萬字元
XiaomiMiMo/MiMo-V2.5-tts-voicecloneFree/百萬字元
XiaomiMiMo/MiMo-V2.5-tts-voicedesignFree/百萬字元
zai-org/GLM-4.6GLM$0.5$2
zai-org/GLM-4.7GLM$0.4$1.75
zai-org/GLM-4.7-FlashGLM$0.06$0.4
zai-org/GLM-5GLM$0.6$2.08
zai-org/GLM-5.1GLM$1.05$3.5
zai-org/GLM-5.2GLM$0.93$3