Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Платформа корпоративного уровня, собранная и протестированная в ЕС.
Кентино AI 192 Рим RTXPro6000 4000TOPS
192 ГБ ECC Blackwell Flagship Pair
2x RTX Pro 6000 Server Edition | EPYC Milan | 4 000 TOPS INT8
Две пассивные видеокарты RTX Pro 6000 Blackwell Server Edition — по 96 ГБ ECC каждая. Меньше накладных расходов на параллельное выполнение тензорных операций, чем в конфигурациях с 4 или 8 видеокартами. Флагманская пара для центров обработки данных.
Сервер для инференции в стоечном исполнении 4U с двумя пассивными видеокартами RTX Pro 6000 Blackwell Server Edition (96 ГБ ECC GDDR7 на карту), одним процессором AMD EPYC 7643 Milan (48 ядер/96 потоков), 256 ГБ оперативной памяти DDR4 ECC, загрузочным NVMe-накопителем на 2 ТБ и одним блоком питания ATX мощностью 2 кВт. Для 70-битного bf16 и среднего размера MoE меньшее количество больших карт превосходит большее количество маленьких — параллельная обработка тензоров с использованием двух карт имеет минимальные накладные расходы на обмен данными, и каждая карта на 96 ГБ содержит полную копию большинства моделей.
Металлоизделия
| Компонент | XNUMX |
|---|---|
| Графические процессоры | 2x NVIDIA RTX Pro 6000 Blackwell Server Edition 96 ГБ ECC GDDR7 (пассивный режим, 600 Вт, PCIe 5.0 x16, двухслотовый) |
| пул видеопамяти | 192 ГБ ECC (96 ГБ x 2) — каждая карта вмещает автономную карту памяти модели 70B bf16. |
| ЦП | AMD EPYC 7643 Milan (48 ядер/96 потоков, 225 Вт, 128 линий PCIe 4.0) |
| Материнская плата | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| ОЗУ системы | 256 ГБ DDR4-2666 ECC RDIMM (4 x 64 ГБ) |
| Загрузка / хранилище | 2 ТБ NVMe M.2 (PCIe 4.0 x4) |
| Источник питания | 1 блок питания ATX 2 кВт |
| Шасси | 4U стоечный корпус с направленным потоком воздуха спереди назад. |
| Охлаждение | Морозильная камера Arctic Freezer 4U-M SP3, башня + 3 фронтальных воздухозаборника 120 мм + 1 задний вытяжной патрубок 120 мм |
| Cеть | Встроенные два порта 10 Гбит/с Ethernet (Intel X550) |
Огибающая мощности
- Потребляемая мощность видеокарты: 2 x 600 Вт = 1800 Вт
- Суммарная мощность системы при полной нагрузке: ~4080 Вт
- Общая мощность блока питания: 2000 Вт (один блок питания 2 кВт) — запас мощности 23.7 %.
- Достаточно одного блока питания; опционально можно установить два блока питания для обеспечения резервирования по схеме N+1.
Топология полосы движения
PCIe Gen4 x16 на каждый графический процессор (карта изначально поддерживает Gen5; плата Rome ограничивается Gen4). Прямое подключение к корневому комплексу — без коммутатора PCIe. Нет NVLink — прямое соединение между графическими процессорами. Пять слотов x16 остаются свободными для расширения. Разница между Gen4 и Gen5 незначительна при такой плотности видеопамяти.
Что вы можете запустить
Благодаря 192 ГБ видеопамяти ECC на двух картах Blackwell с поддержкой нативных fp8/fp4, это самый простой способ получить плотный поток 70 байт при bf16 и средний MoE. Два независимых потока по 70 байт — по одному на карту — или 200 байт MoE на обеих картах с минимальными накладными расходами на двустороннюю передачу данных.
Магистратура по направлению «Текст / Логическое мышление / Программирование»
Китайская граница
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 ГБ) с высокой пропускной способностью (~15-25 токена/с в одном потоке на двух картах); Qwen3-Coder-480B-A35B Q2 (~160 ГБ); Qwen3.5-122B-A10B fp8 (~75 ГБ); Qwen3-32B с высокой плотностью кадров в секунду (bf16) и огромным значением KV; QwQ-32B bf16
- ДипСик: DeepSeek-V3/R1 Q2 (~215 ГБ с небольшим выделением оперативной памяти) — Blackwell работает с fp8 в нативном режиме; DeepSeek-R2 32B bf16 — два одновременных потока (по одному на карту).
- GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 ГБ) — лучшая конфигурация на этом уровне; GLM-4.5-Air fp8 или bf16 с огромным КВ.
- Тенсент Хунюань: Hunyuan-Large Q3 (~160 ГБ) — 389B MoE с 256k ctx; Hunyuan-A13B fp8 native (~80 ГБ) с огромным KV
- Другое: Baidu ERNIE-4.5-424B Q3 (~180 ГБ); InternVL3.5-241B-A28B Q4 (~135 ГБ); MiniMax-M1 Q3 (~180 ГБ)
Западная граница
- Мета Лама: Llama 3.3 70B bf16 на одной карте — два независимых одновременных потока по 70B (~20-30 токенов/с на поток); Llama 4 Scout bf16 (~218 ГБ, мало места); Llama 4 Maverick Q3 (~188 ГБ)
- Мистраль: Mistral Large 2 / Pixtral Large / Devstral 2 123B Q6 (~88 ГБ) — одна карта памяти или bf16 на обеих; Mistral Small 3 — многопотоковая передача.
- OpenAI (открытые веса): gpt-oss-120b MXFP4 native (80 ГБ) — помещается на ОДНОЙ карте, два независимых одновременных потока.
- NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 ГБ); Super 49B bf16 на одной карте
- Другое: Cohere Command R+ 104B Q6 (~85 ГБ) на одной карте; Google Gemma 3 27B bf16, несколько одновременных потоков.
Модели языка видения
InternVL3.5-241B-A28B Q4 (~135 ГБ); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 (однокарточная система); Pixtral Large 124B bf16 или Q6; Llama 3.2 90B Vision bf16 (~180 ГБ); Molmo 72B bf16 (~144 ГБ); GLM-4.6V 106B fp8; Gemma 3 27B (мультимодальная система, 2-3 одновременных потока).
Генерация изображения
FLUX.1 [dev] bf16 несколько одновременных потоков; FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 одновременный; HunyuanImage-2.1 bf16 (~34 ГБ) x 2-4 одновременных; HunyuanImage-3.0 base (80B MoE, 13B active) bf16 — помещается на одной карте; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.
Генерация видео
Wan 2.2 MoE dual-expert bf16 full context — помещается на одной карте, два одновременных потока генерации; Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 оба экспертного уровня; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Mochi-1 bf16 (~42 ГБ); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.
Аудио / Речь / TTS
- АСР: Whisper v3 large / turbo (~50x в реальном времени); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
- ТТС: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open; Step-Audio-EditX
- В реальном времени / S2S: Кютай Моши 7Б; Степ-Аудио 2 мини/R1; Qwen2.5-Омни-7Б
- Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2
Обслуживание нескольких моделей/многопользовательского режима
- Два независимых потока 70B — по одному на каждую карту, простейшая форма изоляции арендатора.
- Плотная структура 70B bf16 + поддерживающий стек — LLM на карте 1, изображения/видео/аудио на карте 2
- 200 байт MoE на обеих картах — минимальные накладные расходы на параллельное выполнение тензоров (разделение на две части)
- fp8-native frontier — семейство DeepSeek V3, Hunyuan-Large fp8 с собственными путями Blackwell
Целевые рабочие нагрузки
- Плотная обработка данных в формате bf16 (70B) — две карты, работающие параллельно с тензорами, с минимальными накладными расходами, или одна модель на карту для потоковой обработки.
- 100-150 млрд. MoE на Q4-Q6 (GLM-4.5-Air, Qwen3.5-122B-A10B, Hunyuan-A13B, Llama 4 Scout)
- Вывод границ возможностей, изначально разработанный для FP8 (семейство DeepSeek V3, Hunyuan, Llama 4) — Blackwell запускает fp8 нативно.
- Студия генерации изображений и видео в bf16 (Wan 2.2 T2V-A14B, HunyuanVideo 13B, FLUX.1 [dev])
- Анализ документов с длинным контекстом (MiniMax-M1, Kimi-K2 1.58-битный UD с функцией переполнения буфера)
Измеренная производительность
Опубликованные данные | Технические характеристики NVIDIA RTX Pro 6000 Blackwell Server Edition + результаты тестов сообщества
| эталонный тест | Результат |
|---|---|
| Производительность каждой видеокарты INT8 TOPS (техническое описание NVIDIA) | 2000 ТОПОВ |
| Суммарный INT8 TOPS (2 карты) | 2000 ТОПОВ |
| Пропускная способность памяти на каждую карту | ~1 800 ГБ/с, 96 ГБ ECC GDDR7 |
| Лама 3.3 70B bf16 за карту (общее сообщество) | Однопоточная производительность 15-25 тонн/с, пакетная производительность 60-90 тонн/с. |
| Двухкарточный тензорно-параллельный модуль 70B (сообщество) | Ожидаемая пропускная способность одного потока составляет примерно 30-45 токов/с. |
| Blackwell fp8 native | DeepSeek-V3 fp8, Hunyuan-A13B fp8 работают без повышающего преобразования bf16 |
Опубликованные внешние данные, измерения не проводились на оборудовании Kentino. Компания Kentino опубликует собственные результаты после первой сборки для заказчика.
Не идеально подходит для
- Высокопроизводительное обслуживание нескольких пользователей одновременно — 4x L40 или 6x L4 обеспечивают более эффективное распределение запросов по большему количеству карт.
- Большой кэш ключ-значение при очень длительной обработке контекста — переход на Kentino AI 384 RTXPro6000 8000TOPS
- Обучение — компания Kentino не продает ткани NVLink H-класса.
- Расчет бюджета при объеме памяти 192 ГБ — 8 видеокарт RTX 4090 обойдутся дешевле (за счет экономии на ECC и пассивном охлаждении).
Гарантия и сроки поставки
Гарантия NVIDIA OEM на 3 года для RTX Pro 6000 Server Edition + гарантия на интеграцию с Kentino. В комплект поставки входит сборка, настройка BIOS, установка драйверов, тестирование на долговечность и функциональная проверка. Сроки поставки зависят от наличия компонентов, уточняются при оформлении заказа.
Рекомендуемые дополнения
- Установите два синхронизированных блока питания мощностью 2 кВт для обеспечения резервирования по схеме N+1.
- Увеличьте объем оперативной памяти до 512 ГБ (при наличии 4 свободных слотов DIMM).
- 4 ТБ NVMe для больших библиотек весов и подготовки моделей к использованию.
- Возможность расширения до конфигурации с 4 видеокартами (Kentino AI 384 RTXPro6000 8000TOPS) — корпус имеет слотовое пространство.
- Стойка на 24U + онлайн ИБП 5 кВА
Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.
Это не совсем то, что вам нужно?
Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.