Французский стартап Kog ускоряет работу ИИ-моделей на стандартных GPU в 30 раз

Фото: TechCrunch
Краткий ответ
Французский стартап Kog разрабатывает ПО для ускорения инференса LLM на стандартных GPU до 30 раз. Технология оптимизирует использование памяти и вычислительных мощностей, что снижает затраты и повышает эффективность…
Французский стартап Kog вышел на рынок с амбициозной целью: доказать, что стандартные GPU, используемые в дата-центрах, способны справляться с инференсом больших языковых моделей (LLM) гораздо эффективнее, чем принято считать. В мае компания представила демонстрацию своей технологии, достигнув скорости 3000 токенов в секунду на запрос с использованием небольшой модели Laneformer 2B с 2 млрд параметров. Основатель и CEO Kog Гаэль Деллало утверждает, что аналогичные оптимизации применимы и к крупным моделям, что может кардинально изменить подход к развёртыванию ИИ-инфраструктуры.
Kog фокусируется на программной оптимизации, чтобы «выжать» максимум из существующего оборудования. По словам Деллало, многие компании сталкиваются с задержками при работе с моделями вроде Claude от Anthropic, где ожидание результатов может растягиваться на часы. Стартап уже привлёк внимание более 200 потенциальных клиентов, включая разработчиков игр и приложений, для которых скорость генерации напрямую влияет на доходы. В ближайших планах — ускорение работы крупных моделей в 10 раз, что станет ключевым аргументом для привлечения инвестиций в рамках раунда Series A.
Подход Kog основан на глубоком анализе архитектуры GPU и низкоуровневой оптимизации. Основатель стартапа, ранее работавший в области кибербезопасности и участвовавший в соревнованиях по реверс-инжинирингу, перенёс этот опыт на разработку ПО. Однако такой подход требует значительных временных затрат: на адаптацию технологии под каждый новый чип уходит несколько недель или даже месяцев. В перспективе Kog планирует автоматизировать процесс с помощью агентных систем, чтобы расширить поддержку моделей и оборудования.
На рынке уже есть конкуренты, такие как французский стартап ZML, предлагающий аппаратно-независимое ПО для ускорения инференса. Однако Kog позиционирует себя ближе к научным разработкам, подобным проектам лаборатории Hazy Research из Стэнфорда. Поддержка со стороны европейских инвесторов, включая Bpifrance и Scaleway, подчёркивает стратегическую важность проекта для развития технологической независимости региона.
Частые вопросы
- Что такое инференс в контексте ИИ?
- Инференс — это процесс выполнения обученной модели ИИ для генерации ответов или предсказаний на основе входных данных. В случае LLM это генерация текста.
- Почему ускорение инференса на GPU важно для бизнеса?
- Быстрый инференс сокращает задержки при работе с ИИ-моделями, что критично для приложений реального времени. Это снижает операционные затраты и повышает конкурентоспособность решений.
- Какие GPU поддерживает Kog?
- Пока Kog тестирует технологию на GPU AMD MI300X и Nvidia H200. Поддержка других чипов планируется в будущем.
Лента для Дзен: /feed/dzen.xml · RSS: /feed.xml