comparar

llama.cpp vs vLLM

Os mesmos fatos para os dois, lidos do GitHub toda noite, e a relação que uma pessoa revisou.

llama.cpp vs vLLM
Fatollama.cppvLLM
LinguagemC++Python
LicençaMITApache-2.0
Estrelas130k93k
Última releasev0.6.0v0.31.0
Último push2026-10-062026-10-06
Ritmo de releasespoucas releasescerca de 14 dias entre releases
Contribuidores ativos173+ autores de commits na branch padrão nos últimos 90 dias260+ autores de commits na branch padrão nos últimos 90 dias
Alertasnenhumnenhum
  • Os dois substituem ChatGPT. Alternativas a ChatGPT →

    Parcialllama.cppRuns open-weight models on CPU or GPU, with a built-in server and a minimal web chat.

    ParcialvLLMServes open-weight models behind an OpenAI-compatible API, tuned for GPU throughput.

  • Os dois substituem Claude. Alternativas a Claude →

    Parcialllama.cppRuns open-weight models on CPU or GPU, with a built-in server and a minimal web chat.

    ParcialvLLMServes open-weight models behind an OpenAI-compatible API.