Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan
Кентино · Сервер с пользовательским ИИ

Kentino AI 192 RomeDual 4090 5288TOPS — 8× RTX 4090 — Dual EPYC Milan

Платформа корпоративного уровня, собранная и протестированная в ЕС.

€32.280,00Без НДС · Стоимость доставки рассчитывается при оформлении заказа
В наличии — отправка со склада в ЕС.
ISO 9001 · сертифицированное оборудованиеСклад в ЕС и гарантияБолее 7 лет опыта работы в сфере корпоративного ИИ.Проверено на работоспособность перед отправкой.
Обзор
Доставка и гарантия

Кентино AI 192 РимDual 4090 5288TOPS

192 ГБ видеопамяти, 8-графический сервер для выполнения инференций
8 видеокарт RTX 4090 | Два процессора EPYC Milan | 5 288 TOPS INT8

5 288
INT8 TOPS
192 ГБ
пул видеопамяти
8 графических процессора
тензор параллельный
двойной
Процессор 96C/192T

Флагманский игровой блок с 8-ядерной видеокартой для вывода данных. Объем памяти 192 ГБ по цене потребительской карты на двухсокетной платформе EPYC Milan.

7U-шасси с 8 видеокартами, построенное на базе двух процессоров EPYC 7643 Milan (96 ядер/192 потока), материнской платы ASRock Rack ROME2D32GM-NL dual-SP3, 512 ГБ оперативной памяти DDR4 ECC, 2 ТБ NVMe-накопителя для загрузки и комплекта из 5 блоков питания по 1200 Вт. Восемь видеокарт GeForce RTX 4090 подключаются через активные райзеры PCIe Gen4 с полным x16. Самый дешевый способ получить 192 ГБ данных для инференции MoE на оборудовании Kentino.

Металлоизделия

Компонент XNUMX
Графические процессоры 8 видеокарт NVIDIA GeForce RTX 4090, 24 ГБ GDDR6X (Ada Lovelace, 450 Вт, PCIe 4.0 x16)
пул видеопамяти Общий объем памяти составляет 192 ГБ на 8 видеокартах (NVLink отсутствует на потребительской RTX 4090).
ЦП 2 процессора AMD EPYC 7643 Milan (48 ядер/96 потоков каждый — всего 96 ядер/192 потока, потребляемая мощность 225 Вт каждый, 2x 128 линий PCIe 4.0)
Материнская плата Материнская плата ASRock ROME2D32GM-NL (два слота SP3, PCIe 4.0, 32 слота DDR4 ECC DIMM)
ОЗУ системы 512 ГБ DDR4-2666 ECC RDIMM (8x 64 ГБ — по 4 на разъем для 8-канального баланса)
Загрузка / хранилище 2 ТБ NVMe M.2 (PCIe 4.0 x4)
Источник питания Комплект из 5 серверных блоков питания мощностью 1200 Вт (совместимые с HP, с возможностью горячей замены) + полный комплект адаптеров 12VHPWR.
Шасси 7U корпус на 8 видеокарт (до 10 карт PCIe, включая райзеры)
Стояки 8 активных райзеров PCIe Gen4 x16 (необходимы для увеличения длины кабеля)
Охлаждение 2 башенных кулера Arctic Freezer 4U-M SP3 + вентиляторы для фронтального и тылового обдува, устанавливаемые в стойку.
Cеть Встроенные два порта 10 Гбит/с Ethernet (Intel X550)

Огибающая мощности

  • Потребляемая мощность видеокарты: 8 x 450 Вт = 1800 Вт
  • Потребляемая мощность процессора: 2 x 225 Вт = 450 Вт
  • Суммарная мощность системы при полной нагрузке: ~4080 Вт
  • Общая мощность блока питания: 6000 Вт в активном режиме (5 x 1200 Вт) — запас мощности 30.0 %.

Топология полосы движения

ROME2D32GM-NL предоставляет 2x 128 линий PCIe Gen4 — один пул из 128 линий на каждый разъем EPYC — напрямую к слотам GPU. Активные райзеры Gen4 обеспечивают целостность сигнала. Отсутствует коммутатор PCIe. Отсутствует NVLink. Измеренная скорость передачи данных между GPU составляет 19-22 ГБ/с в одноранговом режиме на тестовом стенде с 4 GPU.

Что вы можете запустить

Благодаря 192 ГБ памяти, распределенной на 8 картах, этот сервер обрабатывает более 200 миллиардов единиц прогнозируемого потребления ресурсов в 4 квартале, обеспечивает 8-сторонний параллельный вывод тензоров, изолированное обслуживание нескольких моделей для каждого клиента и высокую пакетную обработку данных по ценам потребительских карт.

Магистратура по направлению «Текст / Логическое мышление / Программирование»

Китайская граница

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q4 (~132 ГБ) с длительным временем отклика — конфигурация «герой» (~15-25 токена/с в однопоточном режиме на 8 видеокартах RTX 4090); Qwen3-Coder-480B-A35B Q2 (~160 ГБ); Qwen3.5-122B-A10B fp8 (~75 ГБ) многопотоковый режим; Qwen3-32B с плотным потоком bf16 x с несколькими одновременными операциями
  • ДипСик: DeepSeek-V3/R1 Q2 (~215 ГБ с возможностью выгрузки на хост 512 ГБ); DeepSeek-R2 32B bf16 — до 8 одновременных потоков, по одному на карту (~30-40 токенов в секунду на поток).
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 ГБ); GLM-4.5-Air fp8 или bf16; GLM-4.6V 106B
  • Тенсент Хунюань: Hunyuan-Large Q3 (~160 ГБ); Hunyuan-A13B Q4/Q6 (RTX 4090 — это Ada — преобразование fp8 в bf16, использование квантов GGUF)
  • Другое: Baidu ERNIE-4.5-424B Q3 ​​(~180 ГБ); InternVL3.5-241B-A28B Q4 (~135 ГБ); Qwen3.5-397B Q3 (~170 ГБ); MiniMax-M1 Q3 (~180 ГБ)

Западная граница

  • Мета Лама: Llama 3.3 70B bf16 с огромным KV (~20 ток/с в однопоточном режиме Q4, ~179 ток/с в пакетном режиме 32 vLLM — Kentino, измерено на 4-GPU бенчмарке); Llama 4 Scout bf16 (~218 ГБ в плотном режиме); Llama 4 Maverick Q3 (~188 ГБ)
  • Мистраль: Mistral Large 2 / Pixtral Large 123B Q6 comfortable или bf16 (~248 ГБ свободного места); Mistral Small 3 multistream
  • OpenAI (открытые веса): gpt-oss-120b MXFP4 native (80 ГБ) с огромным ключом KV
  • NVIDIA Nemotron: Лама-3.1-Немотрон Ультра 253Б Q4 (~147 ГБ); Супер 49Б бф16
  • Другое: Cohere Command R+ 104B Q6 (~85 ГБ); Google Gemma 3 27B bf16 x multiple streams

Модели языка видения

InternVL3.5-241B-A28B Q4 (~135 ГБ); Qwen3-VL-235B-A22B Q4; Qwen3-VL-32B bf16 multi-stream; Llama 3.2 90B Vision bf16 (~180 ГБ); Pixtral Large 124B Q6; Molmo 72B bf16; GLM-4.6V 106B fp8/Q6; Gemma 3 27B multimodal x multiple streams.

Генерация изображения

FLUX.1 [dev] bf16 — до 8 одновременных потоков генерации (один на карту, ~15-25 с/изображение при fp8); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large bf16 x 8; HunyuanImage-2.1 bf16 (~34 ГБ) x 2-4 одновременных; HunyuanImage-3.0 base (80B MoE, 13B active) bf16; HunyuanDiT; Kolors / Kolors 2.0; AuraFlow; OmniGen v1; PixArt-Sigma.

Генерация видео

Wan 2.2 MoE dual-expert bf16 с полным ctx — несколько одновременных потоков; Wan 2.2 TI2V-5B x 8 одновременных потоков; HunyuanVideo 13B bf16 оба эксперта; HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16; Genmo Mochi-1 bf16; LTX-Video x 8 одновременных потоков; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos.

Аудио / Речь / TTS

  • АСР: Whisper v3 large / turbo x 8 concurrent (~50x realtime per stream); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • ТТС: CosyVoice 2/3; Kokoro 82M; XTTS v2; Stable Audio Open
  • В реальном времени / S2S: Kyutai Moshi 7B x 8 одновременных голосовых потоков; Step-Audio 2 mini/R1; Qwen2.5-Omni-7B
  • Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2

Обслуживание нескольких моделей/многопользовательского режима

  • 8-сторонний тензорно-параллельный вывод MoE 200-250B на уровне Q4 (Qwen3-235B, GLM-4.5/4.6/4.7)
  • Изолированное обслуживание 8 потоков для каждого арендатора — одна карта памяти Q4 объемом 24 ГБ на карту (например, 8 агентов Qwen3-14B)
  • Large-pack 70B — тензорно-параллельный vLLM / SGLang batch-64 aggregate
  • Смешанный парк: 235B MoE на 4 картах (TP4) + FLUX + видео + голосовая связь в реальном времени на оставшихся 4 картах
  • Лаборатория тонкой настройки — 7-34B LoRA / QLoRA с большой партией

Целевые рабочие нагрузки

  • Параллельный вывод тензоров на 8 GPU с использованием пула 192 ГБ — Qwen3-235B Q4, GLM-4.5/4.6/4.7 Q4, Llama 4 Scout bf16
  • Плотная компоновка 70B bf16 (Llama 3.3 70B) с огромным запасом по напряжению для длительных циклов и больших партий.
  • Высокопроизводительный шлюз для пакетного вывода данных — vLLM / SGLang тензорно-параллельный при больших пакетах данных
  • Тонкая настройка моделей класса 7-34B с использованием высокопроизводительных алгоритмов LoRA / QLoRA.
  • WAN 2.2 dual-expert / HunyuanImage-3.0 / FLUX.1 — полнофункциональная студия видео-изображений для рабочих процессов.

Измеренная производительность

Тест Kentino (референсная конфигурация с 4 видеокартами) | 10.04.2026 | 4x RTX 4090 + EPYC 7542 + 512 ГБ DDR4 + ROMED8-2T

эталонный тест Результат
Устойчивые вычисления (fp16, 4-card ref) 647 TFLOPS
vLLM — Llama 3.3 70B AWQ INT4 (одиночный) 8.0 ток/с
vLLM — Llama 3.3 70B AWQ INT4 (партия-32) 179 тонн/с в сумме
llama.cpp — Лама 3.3 70B Q4_K_M (одиночный) 20.3 ток/с декодирование
Совокупные вычисления на 8 графических процессорах (экстраполяция) Ожидается производительность ~1 294 TFLOPS fp16 (почти линейная).
235B Q4 тензорно-параллельный 8-сторонний (сообщество) 15-25 токена/с в одном потоке на 8 видеокартах RTX 4090

Данные для 4 видеокарт измерены на оборудовании Kentino. Экстраполяция для 8 GPU приведена в качестве внешнего эталона. Kentino опубликует собственные данные для 8 GPU после первой сборки для заказчика.

Не идеально подходит для

  • Рабочие нагрузки поколения 5090 (Blackwell fp8 native + более высокий TOPS) — см. Kentino AI 256 TurinDual 5090
  • Обучение с нуля (NVLink недоступен на потребительских видеокартах RTX 4090)
  • Для круглосуточного производства требуется высокая чувствительность к ECC — потребительская версия RTX 4090 не имеет ECC; предпочтительнее использовать 4x L40 или 2x RTX Pro 6000 Server Edition.
  • Hunyuan / DeepSeek fp8 native — RTX 4090 is Ada, fp8 checkpoints upcast to bf16

Гарантия и сроки поставки

2 лет
гарантия на детали
1 год
гарантия на работы
10-28 дней
время выполнения заказа

В комплект поставки входят сборка, настройка BIOS с оптимизацией NUMA для двухпроцессорных систем, установка драйверов, тестирование на работоспособность, тестирование памяти, полное стресс-тестирование 8 видеокарт и настройка среды LLM. Сроки поставки зависят от наличия компонентов, уточняются при оформлении заказа.

Рекомендуемые дополнения

  • Дополнительные 4 ТБ NVMe-накопителя для поэтапного взвешивания и рабочих нагрузок разгрузки MoE.
  • NVIDIA ConnectX-5 100 GbE для многоузлового обслуживания
  • Возможно увеличение объема оперативной памяти до 1 ТБ (16 x 64 ГБ) или 2 ТБ (32 x 64 ГБ) — материнская плата поддерживает 32 слота DIMM.
  • Полноразмерный 24U стоечный шкаф + встроенный ИБП 5 кВА

Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.

Это не совсем то, что вам нужно?

Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.