# TPS Calculator (русский) > Оценка скорости инференса LLM (token/s), VRAM и задержки по GPU, модели, квантизации и фреймворку. Сайт: https://tps.bunai.cc/ Исходный код: https://github.com/adiudiuu/tps Другие языки: [简体中文](/llms.zh.txt) / [繁體中文](/llms.zh-TW.txt) / [English](/llms.txt) / [Español](/llms.es.txt) / [한국어](/llms.ko.txt) / [日本語](/llms.ja.txt) Интерфейс: упрощённый китайский по умолчанию (без query); `?lang=zh-TW` / `?lang=en` / `?lang=ru` / `?lang=es` / `?lang=ko` / `?lang=ja` Каталог (живые счётчики в Library): **410 модели**, **251 GPU**. Данные обновлены **2026-09-14** (`UPDATED_AT_BEIJING`). ## Популярные модели в каталоге | Модель | Почему в списке | |--------|-----------------| | **Intern-S2-397B** | Открытая научная VLM MoE Shanghai AI Lab 397B-A17B (HF / ModelScope, 2026-09-13) | | **DeepSeek V4.1 Flash** | Открытые веса 552B-A16B нативный VLM, контекст 1M (HF MIT, 2026-09-10) | | **Qwen3.8-Max** | Открытые веса 2.4T-A95B (HF / ModelScope, 2026-08-12) | | **Qwen3.8-Flash-Next** | Открытые веса 125B-A6B VLM + n-gram (HF / ModelScope, 2026-08) | | **Qwen3.8-27B** | Открытая плотная VLM (HF / ModelScope, 2026-08-14) | | **Kimi K3** | Крупный MoE, 2026-07 | | **Hy3** | Tencent MoE 295B-A21B (HF / ModelScope, 2026-07) | | **GLM-5.3** | Флагманский MoE GLM-5 (753B-A40B, пост-обучение, 2026-08) | | **Muse Glimmer 30B** | Плотная VLM Meta для локальных агентов (Apache 2.0, 2026-08) | | **GLM-5.3-Flash** | Новейший мультимодальный MoE GLM-5 (320B-A18B, 2026-08) | | **DeepSeek V4** (Pro / Flash) | Предыдущее поколение DeepSeek V4 (2026-04 / 08) | | **MiniMax M3** | Релиз 2026-06 | | **Gemma 4** | Семейство Google Gemma 4 (2026-06) | | **Llama 4** (Maverick / Scout) | Meta Llama 4 MoE | | **Nemotron 3** (Ultra / Super / Nano) | Линейка NVIDIA Nemotron 3 | В Library также остаются более ранние Qwen3 / DeepSeek V3 / Llama 3.x. ## Популярные GPU в каталоге | GPU | Класс | |-----|--------| | **RTX 5090 / 5080 / 4090** | Потребительские | | **B200 SXM / H200 SXM / H100 SXM** | NVIDIA датацентр | | **MI300X** | AMD датацентр | Типичные вопросы: DeepSeek V4 на 8×H200? Сколько VRAM у GLM-5.3-Flash на B200? TPS Qwen3.8-Flash-Next на RTX 5090? Kimi K3 / Hy3 на MI300X? ## Что считает - Decode / Prefill TPS - VRAM: веса, KV cache, накладные; флаги OOM - Задержка: TTFT, TPOT, end-to-end - Roofline: полоса vs вычислительная мощность - Multi-GPU Tensor Parallel Roofline + открытые спецификации GPU × эффективность фреймворка. Теоретический верхний предел, не лабораторный бенч. ## Страницы - [Оценка](https://tps.bunai.cc/?lang=ru) - [Рейтинг скорости](https://tps.bunai.cc/ranking?lang=ru) - [Библиотека](https://tps.bunai.cc/library?lang=ru) - [Подбор конфигурации](https://tps.bunai.cc/solver?lang=ru) - [О проекте](https://tps.bunai.cc/about?lang=ru) ## Фреймворки / квантизация vLLM, TensorRT-LLM, llama.cpp, MLX, SGLang, TGI · FP32–INT2 / GGUF K-quants ## Стек Vue 3 + Vite + Tailwind. Только клиент.