Группа: Языковые модели по API
Мультимодальные модели
Нужно, чтобы нейросеть понимала картинки и сканы, а не только текст
Модели, принимающие на вход изображение вместе с текстом (VLM). Генерация картинок — «Генерация изображений»
Решения, которые это умеют (4)
Возможность подтверждена модулями, которые разработчик описал у себя на сайте, — они названы под решением.