Inferact
Inferact is the commercial company built by the creators and core maintainers of vLLM — the most widely deployed open-source engine for running large language models efficiently. vLLM was originally developed at UC Berkeley's Sky Computing Lab and now runs on 400,000+ GPUs worldwide, with 2,000+ open-source contributors. Inferact operates an "open core" model: vLLM stays community-owned and PyTorch Foundation-governed, while Inferact sells managed services, optimized cloud deployments, and enterprise-grade tooling on top. The core technology uses techniques like PagedAttention to maximize GPU throughput and minimize memory waste, supporting NVIDIA, AMD, and Google TPU hardware. Buyers are enterprises and cloud providers that need to serve LLMs — including diffusion models, MoE architectures, and agentic workloads — at low cost and high reliability. The founding team (CEO Simon Mo, CTO Woosuk Kwon, Chief Scientist Kaichao You, and co-founder Roger Wang) has advisors Ion Stoica and Joseph Gonzalez of UC Berkeley, giving it unmatched open-source credibility and upstream control.
$800M post-money valuation · 14 employees · 20 open roles
Website · Careers
Open roles
- Member of Technical Staff, Cloud Orchestration (Remote) — Research & Engineering · Remote
- Member of Technical Staff, Cluster Administration — Research & Engineering · San Francisco
- Member of Technical Staff, Site Reliability Engineer — Research & Engineering · San Francisco
- Founding Product Designer — Product · San Francisco
- Head of Engineering — Research & Engineering · San Francisco
- Product Marketing Manager — GTM/Marketing · San Francisco
- Member of Technical Staff, AMD GPU Performance Engineering — Research & Engineering · San Francisco
- Member of Technical Staff, TPU Performance Engineering — Research & Engineering · Singapore
- Member of Technical Staff, AMD GPU Performance Engineering — Research & Engineering · Singapore
- Member of Technical Staff, Performance and Scale — Research & Engineering · Singapore
- Member of Technical Staff, Kernel Engineering — Research & Engineering · Singapore
- Member of Technical Staff, Inference — Research & Engineering · Singapore
- Member of Technical Staff, Cloud Orchestration — Research & Engineering · Singapore
- Member of Technical Staff, Inference — Research & Engineering · San Francisco
- Member of Technical Staff, Developer Relations — Research & Engineering · San Francisco
- Member of Technical Staff, TPU Performance Engineering — Research & Engineering · San Francisco
- Member of Technical Staff, Exceptional Generalist (Remote) — Research & Engineering · Remote
- Member of Technical Staff, Cloud Orchestration — Research & Engineering · San Francisco
- Member of Technical Staff, Kernel Engineering — Research & Engineering · San Francisco
- Member of Technical Staff, Performance and Scale — Research & Engineering · San Francisco