Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan
Кентино · Сервер с пользовательским ИИ

Kentino AI 192 Rome RTXPro6000 4000TOPS — 2× RTX Pro 6000 Blackwell Server Edition — EPYC Milan

Платформа корпоративного уровня, собранная и протестированная в ЕС.

€34.000,00Без НДС · Стоимость доставки рассчитывается при оформлении заказа
В наличии — отправка со склада в ЕС.
ISO 9001 · сертифицированное оборудованиеСклад в ЕС и гарантияБолее 7 лет опыта работы в сфере корпоративного ИИ.Проверено на работоспособность перед отправкой.
Обзор
Доставка и гарантия

Кентино AI 192 Рим RTXPro6000 4000TOPS

192 ГБ ECC Blackwell Flagship Pair
2x RTX Pro 6000 Server Edition | EPYC Milan | 4 000 TOPS INT8

4 000
INT8 TOPS
192 ГБ
ECC VRAM
Блэквелл
fp8 нативный
2 карт
минимальный TP

Две пассивные видеокарты RTX Pro 6000 Blackwell Server Edition — по 96 ГБ ECC каждая. Меньше накладных расходов на параллельное выполнение тензорных операций, чем в конфигурациях с 4 или 8 видеокартами. Флагманская пара для центров обработки данных.

Сервер для инференции в стоечном исполнении 4U с двумя пассивными видеокартами RTX Pro 6000 Blackwell Server Edition (96 ГБ ECC GDDR7 на карту), одним процессором AMD EPYC 7643 Milan (48 ядер/96 потоков), 256 ГБ оперативной памяти DDR4 ECC, загрузочным NVMe-накопителем на 2 ТБ и одним блоком питания ATX мощностью 2 кВт. Для 70-битного bf16 и среднего размера MoE меньшее количество больших карт превосходит большее количество маленьких — параллельная обработка тензоров с использованием двух карт имеет минимальные накладные расходы на обмен данными, и каждая карта на 96 ГБ содержит полную копию большинства моделей.

Металлоизделия

Компонент XNUMX
Графические процессоры 2x NVIDIA RTX Pro 6000 Blackwell Server Edition 96 ГБ ECC GDDR7 (пассивный режим, 600 Вт, PCIe 5.0 x16, двухслотовый)
пул видеопамяти 192 ГБ ECC (96 ГБ x 2) — каждая карта вмещает автономную карту памяти модели 70B bf16.
ЦП AMD EPYC 7643 Milan (48 ядер/96 потоков, 225 Вт, 128 линий PCIe 4.0)
Материнская плата ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
ОЗУ системы 256 ГБ DDR4-2666 ECC RDIMM (4 x 64 ГБ)
Загрузка / хранилище 2 ТБ NVMe M.2 (PCIe 4.0 x4)
Источник питания 1 блок питания ATX 2 кВт
Шасси 4U стоечный корпус с направленным потоком воздуха спереди назад.
Охлаждение Морозильная камера Arctic Freezer 4U-M SP3, башня + 3 фронтальных воздухозаборника 120 мм + 1 задний вытяжной патрубок 120 мм
Cеть Встроенные два порта 10 Гбит/с Ethernet (Intel X550)

Огибающая мощности

  • Потребляемая мощность видеокарты: 2 x 600 Вт = 1800 Вт
  • Суммарная мощность системы при полной нагрузке: ~4080 Вт
  • Общая мощность блока питания: 2000 Вт (один блок питания 2 кВт) — запас мощности 23.7 %.
  • Достаточно одного блока питания; опционально можно установить два блока питания для обеспечения резервирования по схеме N+1.

Топология полосы движения

PCIe Gen4 x16 на каждый графический процессор (карта изначально поддерживает Gen5; плата Rome ограничивается Gen4). Прямое подключение к корневому комплексу — без коммутатора PCIe. Нет NVLink — прямое соединение между графическими процессорами. Пять слотов x16 остаются свободными для расширения. Разница между Gen4 и Gen5 незначительна при такой плотности видеопамяти.

Что вы можете запустить

Благодаря 192 ГБ видеопамяти ECC на двух картах Blackwell с поддержкой нативных fp8/fp4, это самый простой способ получить плотный поток 70 байт при bf16 и средний MoE. Два независимых потока по 70 байт — по одному на карту — или 200 байт MoE на обеих картах с минимальными накладными расходами на двустороннюю передачу данных.

Магистратура по направлению «Текст / Логическое мышление / Программирование»

Китайская граница

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 ГБ) с высокой пропускной способностью (~15-25 токена/с в одном потоке на двух картах); Qwen3-Coder-480B-A35B Q2 (~160 ГБ); Qwen3.5-122B-A10B fp8 (~75 ГБ); Qwen3-32B с высокой плотностью кадров в секунду (bf16) и огромным значением KV; QwQ-32B bf16
  • ДипСик: DeepSeek-V3/R1 Q2 (~215 ГБ с небольшим выделением оперативной памяти) — Blackwell работает с fp8 в нативном режиме; DeepSeek-R2 32B bf16 — два одновременных потока (по одному на карту).
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 ГБ) — лучшая конфигурация на этом уровне; GLM-4.5-Air fp8 или bf16 с огромным КВ.
  • Тенсент Хунюань: Hunyuan-Large Q3 (~160 ГБ) — 389B MoE с 256k ctx; Hunyuan-A13B fp8 native (~80 ГБ) с огромным KV
  • Другое: Baidu ERNIE-4.5-424B Q3 ​​(~180 ГБ); InternVL3.5-241B-A28B Q4 (~135 ГБ); MiniMax-M1 Q3 (~180 ГБ)

Западная граница

  • Мета Лама: Llama 3.3 70B bf16 на одной карте — два независимых одновременных потока по 70B (~20-30 токенов/с на поток); Llama 4 Scout bf16 (~218 ГБ, мало места); Llama 4 Maverick Q3 (~188 ГБ)
  • Мистраль: Mistral Large 2 / Pixtral Large / Devstral 2 123B Q6 (~88 ГБ) — одна карта памяти или bf16 на обеих; Mistral Small 3 — многопотоковая передача.
  • OpenAI (открытые веса): gpt-oss-120b MXFP4 native (80 ГБ) — помещается на ОДНОЙ карте, два независимых одновременных потока.
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q4 (~147 ГБ); Super 49B bf16 на одной карте
  • Другое: Cohere Command R+ 104B Q6 (~85 ГБ) на одной карте; Google Gemma 3 27B bf16, несколько одновременных потоков.

Модели языка видения

InternVL3.5-241B-A28B Q4 (~135 ГБ); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 (однокарточная система); Pixtral Large 124B bf16 или Q6; Llama 3.2 90B Vision bf16 (~180 ГБ); Molmo 72B bf16 (~144 ГБ); GLM-4.6V 106B fp8; Gemma 3 27B (мультимодальная система, 2-3 одновременных потока).

Генерация изображения

FLUX.1 [dev] bf16 несколько одновременных потоков; FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 одновременный; HunyuanImage-2.1 bf16 (~34 ГБ) x 2-4 одновременных; HunyuanImage-3.0 base (80B MoE, 13B active) bf16 — помещается на одной карте; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.

Генерация видео

Wan 2.2 MoE dual-expert bf16 full context — помещается на одной карте, два одновременных потока генерации; Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 оба экспертного уровня; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Mochi-1 bf16 (~42 ГБ); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos Predict 2.

Аудио / Речь / TTS

  • АСР: Whisper v3 large / turbo (~50x в реальном времени); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • ТТС: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open; Step-Audio-EditX
  • В реальном времени / S2S: Кютай Моши 7Б; Степ-Аудио 2 мини/R1; Qwen2.5-Омни-7Б
  • Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2

Обслуживание нескольких моделей/многопользовательского режима

  • Два независимых потока 70B — по одному на каждую карту, простейшая форма изоляции арендатора.
  • Плотная структура 70B bf16 + поддерживающий стек — LLM на карте 1, изображения/видео/аудио на карте 2
  • 200 байт MoE на обеих картах — минимальные накладные расходы на параллельное выполнение тензоров (разделение на две части)
  • fp8-native frontier — семейство DeepSeek V3, Hunyuan-Large fp8 с собственными путями Blackwell

Целевые рабочие нагрузки

  • Плотная обработка данных в формате bf16 (70B) — две карты, работающие параллельно с тензорами, с минимальными накладными расходами, или одна модель на карту для потоковой обработки.
  • 100-150 млрд. MoE на Q4-Q6 (GLM-4.5-Air, Qwen3.5-122B-A10B, Hunyuan-A13B, Llama 4 Scout)
  • Вывод границ возможностей, изначально разработанный для FP8 (семейство DeepSeek V3, Hunyuan, Llama 4) — Blackwell запускает fp8 нативно.
  • Студия генерации изображений и видео в bf16 (Wan 2.2 T2V-A14B, HunyuanVideo 13B, FLUX.1 [dev])
  • Анализ документов с длинным контекстом (MiniMax-M1, Kimi-K2 1.58-битный UD с функцией переполнения буфера)

Измеренная производительность

Опубликованные данные | Технические характеристики NVIDIA RTX Pro 6000 Blackwell Server Edition + результаты тестов сообщества

эталонный тест Результат
Производительность каждой видеокарты INT8 TOPS (техническое описание NVIDIA) 2000 ТОПОВ
Суммарный INT8 TOPS (2 карты) 2000 ТОПОВ
Пропускная способность памяти на каждую карту ~1 800 ГБ/с, 96 ГБ ECC GDDR7
Лама 3.3 70B bf16 за карту (общее сообщество) Однопоточная производительность 15-25 тонн/с, пакетная производительность 60-90 тонн/с.
Двухкарточный тензорно-параллельный модуль 70B (сообщество) Ожидаемая пропускная способность одного потока составляет примерно 30-45 токов/с.
Blackwell fp8 native DeepSeek-V3 fp8, Hunyuan-A13B fp8 работают без повышающего преобразования bf16

Опубликованные внешние данные, измерения не проводились на оборудовании Kentino. Компания Kentino опубликует собственные результаты после первой сборки для заказчика.

Не идеально подходит для

  • Высокопроизводительное обслуживание нескольких пользователей одновременно — 4x L40 или 6x L4 обеспечивают более эффективное распределение запросов по большему количеству карт.
  • Большой кэш ключ-значение при очень длительной обработке контекста — переход на Kentino AI 384 RTXPro6000 8000TOPS
  • Обучение — компания Kentino не продает ткани NVLink H-класса.
  • Расчет бюджета при объеме памяти 192 ГБ — 8 видеокарт RTX 4090 обойдутся дешевле (за счет экономии на ECC и пассивном охлаждении).

Гарантия и сроки поставки

2 лет
гарантия на детали
1 год
гарантия на работы
10-28 дней
время выполнения заказа

Гарантия NVIDIA OEM на 3 года для RTX Pro 6000 Server Edition + гарантия на интеграцию с Kentino. В комплект поставки входит сборка, настройка BIOS, установка драйверов, тестирование на долговечность и функциональная проверка. Сроки поставки зависят от наличия компонентов, уточняются при оформлении заказа.

Рекомендуемые дополнения

  • Установите два синхронизированных блока питания мощностью 2 кВт для обеспечения резервирования по схеме N+1.
  • Увеличьте объем оперативной памяти до 512 ГБ (при наличии 4 свободных слотов DIMM).
  • 4 ТБ NVMe для больших библиотек весов и подготовки моделей к использованию.
  • Возможность расширения до конфигурации с 4 видеокартами (Kentino AI 384 RTXPro6000 8000TOPS) — корпус имеет слотовое пространство.
  • Стойка на 24U + онлайн ИБП 5 кВА

Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.

Это не совсем то, что вам нужно?

Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.