85FreeIndexed/ ai-tools

vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

87.6k stars3k contributorsupdated 1h agovllm-project/vllm

About

A high-throughput and memory-efficient inference and serving engine for LLMs

Topics: amd, blackwell, cuda, deepseek, deepseek-v3, gpt, gpt-oss, inference, kimi, llama, llm, llm-serving, model-serving, moe, openai, pytorch, qwen, qwen3, tpu, transformer

Tags

amdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer

GitHub signals

Indexed
stars
87.6k
forks
20k
contributors
3k
last commit
1h ago
Verify on GitHub

Details

Category
AI Tools
Type
AI tool
Pricing
Open source
Visit
vllm.ai

Stack

Pythonamdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer

Engagement

claps
0
views
0

Similar tools