Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell
Кентино · Сервер с пользовательским ИИ

Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 AI-сервер Blackwell

Платформа корпоративного уровня, собранная и протестированная в ЕС.

€28.700,00Без НДС · Стоимость доставки рассчитывается при оформлении заказа
В наличии — отправка со склада в ЕС.
ISO 9001 · сертифицированное оборудованиеСклад в ЕС и гарантияБолее 7 лет опыта работы в сфере корпоративного ИИ.Проверено на работоспособность перед отправкой.
Обзор
Доставка и гарантия

Кентино AI 128 Рим 5090 6704TOPS

128 ГБ видеопамяти, сервер Blackwell Inference
4x RTX 5090 | EPYC Milan | 6 704 TOPS INT8

6 704
INT8 TOPS
128 ГБ
пул видеопамяти
Блэквелл
fp8 нативный
2.5x
против 4090 ТОПС

Четыре видеокарты Blackwell RTX 5090 с поддержкой нативных тензорных путей fp8/fp4. Максимальная производительность системы из 4 видеокарт на платформе Rome.

Сервер для вывода данных в корпусе 4U, монтируемый в стойку, оснащен четырьмя видеокартами GeForce RTX 5090 с общим объемом видеопамяти 128 ГБ, одним процессором AMD EPYC 7643 Milan (48 ядер/96 потоков), 512 ГБ оперативной памяти DDR4 ECC (все 8 слотов DIMM заняты для максимальной пропускной способности), загрузочным NVMe-накопителем объемом 2 ТБ и двумя синхронизированными блоками питания ATX мощностью 2 кВт. Работает с vLLM, SGLang, llama.cpp, ComfyUI и ядрами вывода данных fp8 и MXFP4, разработанными специально для Blackwell.

Металлоизделия

Компонент XNUMX
Графические процессоры 4 видеокарты NVIDIA GeForce RTX 5090, 32 ГБ GDDR7 (Blackwell, 575 Вт, PCIe 5.0 x16)
пул видеопамяти Всего 128 ГБ на 4 картах (NVLink отсутствует в потребительской версии 5090).
ЦП AMD EPYC 7643 Milan (48 ядер/96 потоков, 225 Вт, 128 линий PCIe 4.0)
Материнская плата ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
ОЗУ системы 512 ГБ DDR4-2666 ECC RDIMM (8 x 64 ГБ — все слоты DIMM заняты)
Загрузка / хранилище 2 ТБ NVMe M.2 (PCIe 4.0 x4)
Источник питания Комплект из двух блоков питания ATX мощностью 2 кВт с кабелем синхронизации и адаптером 12VHPWR.
Шасси 4U стойка, 4 видеокарты, пассивные райзеры PCIe 4.0 x16
Охлаждение Морозильная камера Arctic Freezer 4U-M SP3, башня + 3 фронтальных воздухозаборника 120 мм + 1 задний вытяжной патрубок 120 мм
Cеть Встроенные два порта 10 Гбит/с Ethernet (Intel X550)

Огибающая мощности

  • Потребляемая мощность видеокарты: 4 x 575 Вт = 1800 Вт
  • Суммарная мощность системы при полной нагрузке: ~4080 Вт
  • Общая мощность блока питания: 4000 Вт (два синхронизированных блока по 2 кВт) — запас мощности 33.8 %.
  • Двойной блок питания для раздельного распределения мощности — каждый блок питания питает часть системы.

Топология полосы движения

ROMED8-2T разветвляет 128 линий PCIe Gen4 от EPYC непосредственно на семь слотов x16; четыре из них заняты графическими процессорами Gen4 x16. Отсутствует коммутатор PCIe. В потребительской версии 5090 отсутствует NVLink — используется одноранговое соединение между графическими процессорами. Карты изначально работают с Gen5; Rome ограничивается Gen4.

Что вы можете запустить

Благодаря 128 ГБ объединенной видеопамяти и встроенным в Blackwell тензорным каналам fp8, этот сервер обеспечивает поддержку Qwen3-235B-A22B Q4 и gpt-oss-120b MXFP4 с реальным запасом по KV — превосходящим возможности 4x RTX 4090.

Магистратура по направлению «Текст / Логическое мышление / Программирование»

Китайская граница

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-235B-A22B Q3-Q4 (~112-132 ГБ) подходит для пула в 128 ГБ с 8-16 тыс. транзакций — конфигурация «герой»; Qwen3-32B с высокой плотностью BF16 (~65 ГБ) с огромным количеством КВ; Qwen3-Coder-30B-A3B с агентным управлением при 1 млн транзакций; Qwen3.5-122B-A10B Q6/fp8 (~75-80 ГБ); QwQ-32B с рассуждениями о BF16
  • ДипСик: DeepSeek-V3/R1/V3.1/V3.2 fp8-native Q2 (~215 ГБ) с распределением оперативной памяти по хосту объемом 512 ГБ — подходит для пакетной обработки; DeepSeek-R2 32B bf16 многопотоковая обработка (4 одновременных потока, по одному на карту)
  • GLM / Z.ai: GLM-4.5-Air 106B/12B fp8 (~106 ГБ) или Q6 работают без проблем; GLM-4.5/4.6/4.7 Q2_K_XL (~135 ГБ) работают с высокой производительностью при разгрузке MoE.
  • Тенсент Хунюань: Hunyuan-A13B fp8 native (~80 ГБ) — Blackwell работает с fp8 без потерь на преобразование адресов вверх; Hunyuan-Large Q2 с использованием свободного места в оперативной памяти.
  • ByteDance Seed-OSS-36B bf16 с нативным объемом 512 КБ; ERNIE-4.5-424B Q2 (~150 ГБ выгрузки)

Западная граница

  • Мета Лама: Llama 3.3 70B Q4 на 4x 5090 (~30-40 ток/с в однопоточном режиме, ~270+ ток/с в пакетном режиме - 32 vLLM); Llama 4 Scout 109B/17B MoE fp8/Q6 (~90 ГБ); Llama 4 Maverick 400B/17B Q3 (~188 ГБ выгрузки)
  • Мистраль: Mistral Small 3 / Magistral / Devstral Small 2 (24B) bf16 multi-stream; Pixtral Large / Mistral Large 2 (123B) Q6 (~88 GB)
  • OpenAI (открытые веса): gpt-oss-120b MXFP4 native (80 ГБ) с реальным контекстом ключ-значение и длинным контекстом — рабочая нагрузка Blackwell hero; gpt-oss-20b MXFP4
  • Google Gemma 3: 27B многомодальный bf16 (~54 ГБ), два одновременных потока; 12B / 4B
  • Майкрософт Фи-4 14B плотный bf16; Phi-4-рассуждение дистиллированный
  • NVIDIA Nemotron: Llama-3.1-Nemotron Ultra 253B Q3 (~119 ГБ) tight; Super 49B bf16 (~98 ГБ)
  • Другое: Cohere Command R+ 104B Q6 (~85 ГБ); Molmo 72B Q6-bf16 VLM; OLMo 2 32B; IBM Granite 4.0 H-Small

Модели языка видения

Qwen3-VL-235B-A22B Q3-Q4; Qwen3-VL-32B bf16; InternVL3.5-241B-A28B Q4 (~135 ГБ, компактный размер); InternVL3 78B bf16; Llama 3.2 90B Vision Q6 (~74 ГБ); Pixtral Large 124B Q6 (~88 ГБ); Molmo 72B Q6/bf16; Gemma 3 27B multimodal bf16; GLM-4.6V 106B fp8.

Генерация изображения

FLUX.1 [dev] bf16 и fp8 (~10-18 с/изображение при fp8); FLUX.1 Kontext [dev]; SD 3.5 Large bf16; HunyuanImage-2.1 bf16 и Q4; HunyuanImage-3.0 base (80B MoE, 13B active) bf16 (~80 ГБ, основной размер); HunyuanDiT; Kolors / Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.

Генерация видео

Wan 2.2 MoE two-expert bf16 (~54 ГБ, полный ctx); Wan 2.2 TI2V-5B; HunyuanVideo 13B bf16 оба эксперта (~60-80 ГБ); HunyuanVideo 1.5; CogVideoX-5B bf16; Open-Sora 2.0 11B bf16 (~24 ГБ); Genmo Mochi-1 bf16 (~42 ГБ); LTX-Video; Pyramid Flow; SVD / SV3D / SV4D; NVIDIA Cosmos.

Аудио / Речь / TTS

  • АСР: Whisper v3 large / turbo (~50x в реальном времени); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • ТТС: CosyVoice 2 / 3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
  • В реальном времени / S2S: Кютай Моши 7Б; Степ-Аудио 2 мини/R1; Qwen2.5-Омни-7Б
  • Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2

Обслуживание нескольких моделей/многопользовательского режима

  • 200B MoE на 4 квартале с пакетным выводом (Qwen3-235B, GLM-4.5/4.6/4.7-Air) для 8-16 одновременно работающих пользователей.
  • fp8-native frontier — семейство DeepSeek V3, Hunyuan-Large fp8 с собственными путями Blackwell
  • Смешанный стек резидентных модулей: gpt-oss-120b MXFP4 + FLUX.1 + Whisper + Moshi на разделенной видеопамяти.
  • Высокопроизводительная система 70B — тензорно-параллельный vLLM / SGLang с пакетной агрегацией более 200 ток/с.

Целевые рабочие нагрузки

  • Производство более 200 млрд тонн в месяц, ввод в эксплуатацию в 3-4 квартале с реальными КВ (Qwen3-235B, GLM-4.5-Air 106B).
  • fp8-native frontier inference (DeepSeek V3/R1 fp8, Hunyuan fp8) — Blackwell runs without upcast
  • Высокопроизводительная обработка 70 миллиардов запросов — пакетная обработка с использованием тензоров через vLLM или SGLang.
  • Студия видеопроизводства в bf16 (Wan 2.2 dual-expert, HunyuanVideo 13B, Mochi-1)
  • Многопользовательская смешанная нагрузка — 120B MoE + генерация изображений + голосовая связь в реальном времени, все устройства находятся в системе.

Измеренная производительность

Опубликованные данные | Технические характеристики NVIDIA RTX 5090 + результаты тестов сообщества

эталонный тест Результат
Производительность каждой видеокарты INT8 TOPS (техническое описание NVIDIA) 2000 ТОПОВ
Суммарный INT8 TOPS (4 карты) 2000 ТОПОВ
Пропускная способность памяти на каждую карту ~1 792 ГБ/с
Llama 3.3 70B Q6 через vLLM (сообщество) Однопоточная производительность 60-90 тонн/с, пакетная производительность 300+ тонн/с.
Qwen3-235B-A22B Q3-Q4 Подходит для пула объемом 128 ГБ с транзакциями 8-16 тыс.
gpt-oss-120b MXFP4 native 80 ГБ — комфортно с запасом по напряжению (кВ).

Опубликованные внешние данные, измерения не проводились на оборудовании Kentino. Компания Kentino опубликует собственные результаты после первой сборки для заказчика.

Не идеально подходит для

  • Frontier 400B+ в 4 квартале (Kimi-K2, Mistral Large 3, Intern-S1-Pro — требуется 8 видеокарт или 6 видеокарт RTX Pro 6000)
  • Для рабочих нагрузок, чувствительных к частоте каналов PCIe Gen5, выберите модель Genoa с поддержкой нативного интерфейса Gen5 x16.
  • Обучение с нуля (NVLink недоступен на потребительской модели 5090)
  • Для круглосуточного производства требуется высокая чувствительность к ECC — потребительская версия 5090 не имеет ECC; предпочтительнее использовать L40 или RTX Pro 6000 Server Edition.

Гарантия и сроки поставки

2 лет
гарантия на детали
1 год
гарантия на работы
10-28 дней
время выполнения заказа

В комплект поставки входят сборка, настройка BIOS, установка драйверов, тестирование на работоспособность и функциональная проверка. Срок выполнения зависит от наличия компонентов, которое подтверждается при оформлении заказа.

Рекомендуемые дополнения

  • Для стабильной работы в режиме BF16 + видео на пределе возможностей рекомендуется использовать блок питания мощностью два 2.5 кВт (FSP) — рекомендуется для круглосуточной работы.
  • 4 ТБ NVMe для библиотеки моделей + поэтапное распределение весов MoE
  • Открытый шкаф высотой 24U для развертывания нескольких серверов.
  • По запросу рассмотрите вариант платформы Genoa для соединения Gen5 x16.

Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.

Это не совсем то, что вам нужно?

Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.