Kentino AI 144 Rome L4 1452TOPS — 6 × NVIDIA L4 — EPYC Милан
Платформа корпоративного уровня, собранная и протестированная в ЕС.
Кентино AI 144 Рим L4 1452TOPS
144 ГБ видеопамяти, сервер бесшумного вывода данных на периферии сети
6x NVIDIA L4 Пассивные | EPYC Milan | 1 452 TOPS INT8
Шесть пассивных плат L4 для центров обработки данных. Самый тихий сервер ИИ в линейке Kentino — подходит для развертывания на периферии офисных помещений.
Однопроцессорный сервер для выполнения инференции в форм-факторе 4U с шестью пассивными картами NVIDIA L4 (по 24 ГБ каждая, общий пул 144 ГБ), одним процессором AMD EPYC 7643 Milan (48 ядер/96 потоков), 384 ГБ оперативной памяти DDR4 ECC, 2 ТБ NVMe для загрузки и одним блоком питания ATX мощностью 2 кВт с запасом мощности 62%. Надежный сервер для выполнения инференции в плотной сети, предназначенный для встраивания парков серверов, обслуживания LLM-систем в многопользовательских средах малого и среднего размера, а также для развертывания с низким энергопотреблением на запрос вблизи офисных помещений.
Металлоизделия
| Компонент | XNUMX |
|---|---|
| Графические процессоры | 6x NVIDIA L4 24 ГБ (Ada Lovelace, пассивный, 72 Вт, однослотовый LP, PCIe Gen4 x8) |
| пул видеопамяти | Общий объем данных по 6 картам составляет 144 ГБ. |
| ЦП | AMD EPYC 7643 Milan (48 ядер/96 потоков, 225 Вт, 128 линий PCIe 4.0) |
| Материнская плата | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| ОЗУ системы | 384 ГБ DDR4-2666 ECC RDIMM (6 x 64 ГБ) |
| Загрузка / хранилище | 2 ТБ NVMe M.2 (PCIe 4.0 x4) |
| Источник питания | 1 блок питания ATX 2 кВт |
| Шасси | 4U для установки в стойку (размещение на 6 плат) |
| Охлаждение | Башенный кулер SP3 + направленный поток воздуха спереди назад (промышленные вентиляторы) |
| Cеть | Встроенные два порта 10 Гбит/с Ethernet (Intel X550) |
Огибающая мощности
- Потребляемая мощность графического процессора: 6 x 72 Вт = 432 Вт
- Суммарная мощность системы при полной нагрузке: ~757 Вт
- Общая мощность блока питания: 2000 Вт — запас мощности 62 %.
- Бесшумная работа, огромный тепловой запас.
Топология полосы движения
L4 — это нативный PCIe Gen4 x8, без потери пропускной способности по сравнению с хостом. ROMED8-2T предоставляет 7 слотов x16; один слот остается свободным для установки сетевой карты. PCIe-переключатель не требуется. NVLink отсутствует.
Что вы можете запустить
При суммарном объеме 144 ГБ на 6 физических картах оптимальным вариантом является одновременная обработка нескольких моделей: одновременное выполнение 70-битной модели с высокой плотностью данных в Q4, 30-битной модели MoE, 14-битного кодера, модели VLM и модели встраивания с сохранением запаса по ключу «ключ-значение».
Магистратура по направлению «Текст / Логическое мышление / Программирование»
Китайская граница
- Qwen3 / Qwen3.5 (Alibaba): Qwen3-30B-A3B Q4-Q6; QwQ-32B Q6; Qwen3-32B dense Q6; Qwen3.5-122B-A10B Q4-Q5 (~75 ГБ, комфортно); Qwen3-235B-A22B Q3 (~112 ГБ), компактный, короткий ctx
- ДипСик: DeepSeek-R2 32B sparse MoE Q4-Q6 (совместимость с одной видеокартой, 6 одновременных потоков, ~15-20 токенов/с на поток); Seed-OSS-36B Q4-Q6 с собственным контекстом 512k
- GLM / Z.ai: GLM-4.5-Air Q4-Q5 (60-70 ГБ комфортно); Hunyuan-A13B Q4-Q6 (~48 ГБ)
- Baidu ERNIE-4.5-47B-A3B Q4; Шаг 3.5 - Прошивка Q3-Q4 с небольшим объемом оперативной памяти.
Западная граница
- Мета Лама: Llama 3.3 70B Q4-Q6 (43-58 ГБ) с большим объемом памяти (~10-17 ток/с в однопоточном режиме через 6 параллельных тензоров L4); Llama 4 Scout 109B/17B MoE Q4 (~63 ГБ) — комфортная работа.
- Мистраль: Mistral Small 3 / Magistral Small 1.2 / Devstral Small 2 (24B) на bf16 (~50-65 токов/с за карту L4); Mixtral 8x22B Q4
- OpenAI (открытые веса): gpt-oss-120b MXFP4 native (~80 ГБ) с запасом места; gpt-oss-20b MXFP4
- Google Gemma 3: 27B bf16; Phi-4 14B bf16
- NVIDIA Nemotron: Лама-3.1-Немотрон Супер 49Б Q4-Q6; Pixtral 12B / Pixtral Large Q4 (~72 ГБ)
Модели языка видения
Qwen3-VL-8B/32B, Qwen3-VL-30B-A3B MoE, InternVL3 до 78B Q4 (~48 ГБ), InternVL3.5-38B, DeepSeek-VL2, Llama 3.2 11B Vision bf16, Llama 3.2 90B Vision Q4 (~52 ГБ), Molmo 72B Q4, Gemma 3 12B/27B multimodal, MiniCPM-V 2.6 / MiniCPM-o 2.6, GLM-4.6V-Flash.
Генерация изображения
FLUX.1 [dev] / [schnell] fp8 (~20-35 с/изображение на одном L4 при fp8); FLUX.1 Kontext [dev]; FLUX Tools; SD 3.5 Large (18 ГБ fp16 / 11 ГБ fp8); SDXL 1.0; HunyuanImage-2.1 (~34 ГБ bf16); HunyuanDiT; Kolors 2.0; AuraFlow v0.3; OmniGen v1; PixArt-Sigma.
Генерация видео
Wan 2.2 T2V-A14B/I2V-A14B MoE (туго на bf16 ~54 ГБ); Wan 2.2 TI2V-5B быстрый путь; HunyuanVideo 13B Q4-Q8 (~30 ГБ); ХунюаньВидео 1.5 (8.3B); CogVideoX-5B; Опен-Сора 2.0 Q8 (~16 ГБ); Мочи-1 Q4 (~18 ГБ); LTX-Видео; Пирамидальный поток; СВД/СВ3Д/СВ4Д; NVIDIA Космос.
Аудио / Речь / TTS
- АСР: Whisper v3 large / turbo (~50x в реальном времени); Parakeet-TDT; Canary 1B; Qwen3-ASR; SenseVoice
- ТТС: CosyVoice 2 / 3; Kokoro 82M; Stable Audio Open; XTTS v2; StyleTTS 2; Step-Audio-EditX
- В реальном времени / S2S: Кютай Моши 7Б; Степ-Аудио 2 мини/R1; Qwen2.5-Омни-7Б
- Музыка / Звуковые эффекты: MusicGen / AudioGen / Bark; SeamlessM4T v2
Обслуживание нескольких моделей/многопользовательского режима
- 6 одновременных потоков данных с карты Q4 объемом 24 ГБ (по одному на карту): например, 6 агентов Qwen3-14B Q4.
- Смешанный парк: Llama 3.3 70B Q4 (тензорный параллельный интерфейс на 2 платах) + FLUX.1 (1 плата) + Whisper-turbo (1 плата) + Moshi (1 плата) + BGE-M3 embedder (1 плата)
- Сервис встраивания с высокой частотой кадров — 6 параллельных потоков встраивания BGE-M3 / E5 / Nomic / Cohere Embed
- Ферма по транскодированию видео — 6 параллельных потоков NVENC/NVDEC
Целевые рабочие нагрузки
- Многопользовательский API LLM для SaaS — обслуживание 20-40 одновременных пользователей в модели 24B/32B с возможностью добавления изображений и ASR.
- RAG бэкенд — встраивание запросов + считыватель Q4 объемом 70 байт + переранжировщик, задержка менее секунды, 50 запросов в секунду
- Конвейер обработки видео с использованием ИИ — транскодирование в реальном времени + добавление субтитров + модерация на 6 параллельных потоках
- Устройство Edge AI рядом с офисом — низкий уровень шума, отсутствие зависимости от центров обработки данных.
- Научно-исследовательский стенд для моделей среднего уровня — быстрая итерация тонкой настройки 30-70B, одна карта на эксперимент.
Измеренная производительность
Опубликованные ссылки | Технические характеристики NVIDIA L4 + результаты тестов сообщества
| эталонный тест | Результат |
|---|---|
| Производительность каждой видеокарты INT8 TOPS (техническое описание NVIDIA) | 242 TOPS |
| Суммарный INT8 TOPS (6 карты) | 2000 ТОПОВ |
| Лама 3.1 8B Q4 на одном L4 (сообщество) | ~35-45 ток/с однопотоковый |
| Встраивание QPS в BGE-M3 на уровне L4 (сообщество) | ~800 запросов в секунду при входных данных из 512 токенов |
| Whisper v3 turbo realtime factor | Примерно в 1.5-2 раза быстрее в реальном времени на каждую карту |
Опубликованные внешние данные, измерения не проводились на оборудовании Kentino. Компания Kentino опубликует собственные результаты после первой сборки для заказчика.
Не идеально подходит для
- Frontier 200B+ MoE в 4 квартале+ с долгосрочным контекстом — 4x L40 или 8x RTX 4090 (пул 192 ГБ, непрерывная транзакция) — это оптимальный вариант.
- Нагрузка на обучение — L4 не хватает FP8 и пропускной способности для эффективного обучения.
- Максимальная пропускная способность при выполнении одной рабочей нагрузки — вычислительные ресурсы на одну видеокарту невелики по сравнению с L40 / RTX Pro 6000.
Гарантия и сроки поставки
Гарантия NVIDIA OEM на 3 года на L4 + гарантия на интеграцию Kentino. В комплект поставки входит сборка, настройка BIOS, установка драйверов, тестирование на работоспособность и функциональная проверка. Срок выполнения заказа зависит от наличия компонентов, уточняется при оформлении заказа.
Рекомендуемые дополнения
- Обновление до 4 ТБ NVMe для подготовки библиотеки моделей
- 24U открытый стоечный шкаф с управляемым блоком распределения питания (PDU)
Отправка осуществляется с нашего склада в ЕС. Для тяжелых товаров может потребоваться организация доставки — свяжитесь с нами для уточнения стоимости и сроков доставки. Ограниченная гарантия сроком на 2 года с расширенной поддержкой по возврату товара; доступна расширенная гарантия.
Это не совсем то, что вам нужно?
Расскажите нам о вашей рабочей нагрузке, и мы подберем для этой платформы параметры, соответствующие вашим реальным задачам — видеокарты, память, хранилище и система охлаждения.