Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан
Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан
Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан
Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан
Кентино · Сервер с пользовательским ИИ

Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан

Платформа корпоративного уровня, собранная и протестированная в ЕС.

€30.274,00Без НДС · Стоимость доставки рассчитывается при оформлении заказа
В наличии — отправка со склада в ЕС.
ISO 9001 · сертифицированное оборудованиеСклад в ЕС и гарантияБолее 7 лет опыта работы в сфере корпоративного ИИ.Проверено на работоспособность перед отправкой.
Обзор
Доставка и гарантия

Кентино AI 144 Рим L4 1452TOPS

144 ГБ видеопамяти, сервер бесшумного вывода данных на периферии сети
6x NVIDIA L4 Пассивные | EPYC Milan | 1 452 TOPS INT8

1 452
INT8 TOPS
144 ГБ
пул видеопамяти
432 W
GPU-оболочка
тихий
пассивные графические процессоры

Шесть пассивных плат L4 для центров обработки данных. Самый тихий сервер ИИ в линейке Kentino — подходит для развертывания на периферии офисных помещений.

Однопроцессорный сервер для выполнения инференции в форм-факторе 4U с шестью пассивными картами NVIDIA L4 (по 24 ГБ каждая, общий пул 144 ГБ), одним процессором AMD EPYC 7643 Milan (48 ядер/96 потоков), 384 ГБ оперативной памяти DDR4 ECC, 2 ТБ NVMe для загрузки и одним блоком питания ATX мощностью 2 кВт с запасом мощности 62%. Надежный сервер для выполнения инференции в плотной сети, предназначенный для встраивания парков серверов, обслуживания LLM-систем в многопользовательских средах малого и среднего размера, а также для развертывания с низким энергопотреблением на запрос вблизи офисных помещений.

Металлоизделия

Компонент XNUMX
Графические процессоры 6x NVIDIA L4 24 ГБ (Ada Lovelace, пассивный, 72 Вт, однослотовый LP, PCIe Gen4 x8)
пул видеопамяти Общий объем данных по 6 картам составляет 144 ГБ.
ЦП AMD EPYC 7643 Milan (48 ядер/96 потоков, 225 Вт, 128 линий PCIe 4.0)
Материнская плата ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
ОЗУ системы 384 ГБ DDR4-2666 ECC RDIMM (6 x 64 ГБ)
Загрузка / хранилище 2 ТБ NVMe M.2 (PCIe 4.0 x4)
Источник питания 1 блок питания ATX 2 кВт
Шасси 4U для установки в стойку (размещение на 6 плат)
Охлаждение Башенный кулер SP3 + направленный поток воздуха спереди назад (промышленные вентиляторы)
Cеть Встроенные два порта 10 Гбит/с Ethernet (Intel X550)

Огибающая мощности

  • Потребляемая мощность графического процессора: 6 x 72 Вт = 432 Вт
  • Суммарная мощность системы при полной нагрузке: ~757 Вт
  • Общая мощность блока питания: 2000 Вт — запас мощности 62 %.
  • Бесшумная работа, огромный тепловой запас.

Топология полосы движения

L4 — это нативный PCIe Gen4 x8, без потери пропускной способности по сравнению с хостом. ROMED8-2T предоставляет 7 слотов x16; один слот остается свободным для установки сетевой карты. PCIe-переключатель не требуется. NVLink отсутствует.

Что вы можете запустить

При суммарном объеме 144 ГБ на 6 физических картах оптимальным вариантом является одновременная обработка нескольких моделей: одновременное выполнение 70-битной модели с высокой плотностью данных в Q4, 30-битной модели MoE, 14-битного кодера, модели VLM и модели встраивания с сохранением запаса по ключу «ключ-значение».

Магистратура по направлению «Текст / Логическое мышление / Программирование»

Китайская граница

  • Qwen3 / Qwen3.5 (Alibaba): Qwen3-30B-A3B Q4-Q6; QwQ-32B Q6; Qwen3-32B dense Q6; Qwen3.5-122B-A10B Q4-Q5 (~75 ГБ, комфортно); Qwen3-235B-A22B Q3 (~112 ГБ), компактный, короткий ctx
  • ДипСик: DeepSeek-R2 32B sparse MoE Q4-Q6 (совместимость с одной видеокартой, 6 одновременных потоков, ~15-20 токенов/с на поток); Seed-OSS-36B Q4-Q6 с собственным контекстом 512k
  • GLM / Z.ai: GLM-4.5-Air Q4-Q5 (60-70 ГБ комфортно); Hunyuan-A13B Q4-Q6 (~48 ГБ)
  • Baidu ERNIE-4.5-47B-A3B Q4; Шаг 3.5 - Прошивка Q3-Q4 с небольшим объемом оперативной памяти.

Западная граница

  • Мета Лама: Llama 3.3 70B Q4-Q6 (43-58 ГБ) с большим объемом памяти (~10-17 ток/с в однопоточном режиме через 6 параллельных тензоров L4); Llama 4 Scout 109B/17B MoE Q4 (~63 ГБ) — комфортная работа.
  • Мистраль: Mistral Small 3 / Magistral Small 1.2 / Devstral Small 2 (24B) на bf16 (~50-65 токов/с за карту L4); Mixtral 8x22B Q4
  • OpenAI (открытые веса): gpt-oss-120b MXFP4 native (~80 ГБ) с запасом места; gpt-oss-20b MXFP4
  • Google Gemma 3: 27B bf16; Phi-4 14B bf16
  • NVIDIA Nemotron: Лама-3.1-Немотрон Супер 49Б Q4-Q6; Pixtral 12B / Pixtral Large Q4 (~72 ГБ)

Модели языка видения

Qwen3-VL-8B/32B, Qwen3-VL-30B-A3B MoE, InternVL3 до 78B Q4 (~48 ГБ), InternVL3.5-38B, DeepSeek-VL2, Llama 3.2 11B Vision bf16, Llama 3.2 90B Vision Q4 (~52 ГБ), Molmo 72B Q4, Gemma 3 12B/27B multimodal, MiniCPM-V 2.6 / MiniCPM-o 2.6, GLM-4.6V-Flash.

Генерация изображения

FLUX.1 [dev] / [schnell] fp8 (~20-35 с/изображение на одном L4 при fp8); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large (18 ГБ fp16 / 11 ГБ fp8); SDXL 1.0; HunyuanImage-2.1 (~34 ГБ bf16); HunyuanDiT; Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.

Генерация видео

Wan 2.2 T2V-A14B/I2V-A14B MoE (туго на bf16 ~54 ГБ); Wan 2.2 TI2V-5B быстрый путь; HunyuanVideo 13B Q4-Q8 (~30 ГБ); ХунюаньВидео 1.5 (8.3B); CogVideoX-5B; Опен-Сора 2.0 Q8 (~16 ГБ); Мочи-1 Q4 (~18 ГБ); LTX-Видео; Пирамидальный поток; СВД/СВ3Д/СВ4Д; NVIDIA Космос.

Аудио / Речь / TTS

  • АСР: Whisper v3 large / turbo (~50x в реальном времени); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
  • ТТС: CosyVoice 2 / 3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
  • В реальном времени / S2S: Кютай Моши 7Б; Степ-Аудио 2 мини/R1; Qwen2.5-Омни-7Б
  • Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2

Обслуживание нескольких моделей/многопользовательского режима

  • 6 одновременных потоков данных с карты Q4 объемом 24 ГБ (по одному на карту): например, 6 агентов Qwen3-14B Q4.
  • Смешанный парк: Llama 3.3 70B Q4 (тензорный параллельный интерфейс на 2 платах) + FLUX.1 (1 плата) + Whisper-turbo (1 плата) + Moshi (1 плата) + BGE-M3 embedder (1 плата)
  • Сервис встраивания с высокой частотой кадров — 6 параллельных потоков встраивания BGE-M3 / E5 / Nomic / Cohere Embed
  • Ферма по транскодированию видео — 6 параллельных потоков NVENC/NVDEC

Целевые рабочие нагрузки

  • Многопользовательский API LLM для SaaS — обслуживание 20-40 одновременных пользователей в модели 24B/32B с возможностью добавления изображений и ASR.
  • RAG бэкенд — встраивание запросов + считыватель Q4 объемом 70 байт + переранжировщик, задержка менее секунды, 50 запросов в секунду
  • Конвейер обработки видео с использованием ИИ — транскодирование в реальном времени + добавление субтитров + модерация на 6 параллельных потоках
  • Устройство Edge AI рядом с офисом — низкий уровень шума, отсутствие зависимости от центров обработки данных.
  • Научно-исследовательский стенд для моделей среднего уровня — быстрая итерация тонкой настройки 30-70B, одна карта на эксперимент.

Измеренная производительность

Опубликованные ссылки | Технические характеристики NVIDIA L4 + результаты тестов сообщества

эталонный тест Результат
Производительность каждой видеокарты INT8 TOPS (техническое описание NVIDIA) 242 TOPS
Суммарный INT8 TOPS (6 карты) 2000 ТОПОВ
Лама 3.1 8B Q4 на одном L4 (сообщество) ~35-45 ток/с однопотоковый
Встраивание QPS в BGE-M3 на уровне L4 (сообщество) ~800 запросов в секунду при входных данных из 512 токенов
Whisper v3 turbo realtime factor Примерно в 1.5-2 раза быстрее в реальном времени на каждую карту

Опубликованные внешние данные, измерения не проводились на оборудовании Kentino. Компания Kentino опубликует собственные результаты после первой сборки для заказчика.

Не идеально подходит для

  • Frontier 200B+ MoE в 4 квартале+ с долгосрочным контекстом — 4x L40 или 8x RTX 4090 (пул 192 ГБ, непрерывная транзакция) — это оптимальный вариант.
  • Нагрузка на обучение — L4 не хватает FP8 и пропускной способности для эффективного обучения.
  • Максимальная пропускная способность при выполнении одной рабочей нагрузки — вычислительные ресурсы на одну видеокарту невелики по сравнению с L40 / RTX Pro 6000.

Гарантия и сроки поставки

2 лет
гарантия на детали
1 год
гарантия на работы
10-28 дней
время выполнения заказа

Гарантия NVIDIA OEM на 3 года на L4 + гарантия на интеграцию Kentino. В комплект поставки входит сборка, настройка BIOS, установка драйверов, тестирование на работоспособность и функциональная проверка. Срок выполнения заказа зависит от наличия компонентов, уточняется при оформлении заказа.

Рекомендуемые дополнения

  • Обновление до 4 ТБ NVMe для подготовки библиотеки моделей
  • 24U открытый стоечный шкаф с управляемым блоком распределения питания (PDU)

Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.

Это не совсем то, что вам нужно?

Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.