Single-file GPU/RAM sizing calculator for LLM agent sessions on vLLM: KV-cache offload to RAM, prefix caching, MLA/DSA and hybrid models, TP chosen per model × GPU pair (H100–B300). Runs in the browser, no dependencies.
ai ai-agents ai-agent llm ai-calculator vllm llm-agent llm-inference llm-agents sglang deepseek-v3 vllm-server-config vllm-server deepseek-v4 llm-calculator glm-5-3 glm-5-3-flash qwen38-27b qwen38-flash-next
-
Updated
Sep 24, 2026 - HTML