Мультимодальные модели

Нужно, чтобы нейросеть понимала картинки и сканы, а не только текст

Модели, принимающие на вход изображение вместе с текстом (VLM). Генерация картинок — «Генерация изображений»

Решения, которые это умеют (4)

Возможность подтверждена модулями, которые разработчик описал у себя на сайте, — они названы под решением.

Модули, в которых это описано (4)
МодульТип
Линейка языковых моделей

Разработчик публикует четыре версии с характеристиками: Cotype Pro 3 — 27 млрд параметров, контекстное окно 262 тыс. токенов; Cotype Light 3 — 9 млрд параметров; Cotype Pro 2.6 — 32 млрд, контекст 128 тыс.; Cotype Nano — 1,5 млрд, открытая модель, которая «запускается на ноутбуках и смартфонах». Состав поставки влияет на лицензию: она «зависит от выбранных модулей, формата поставки».

Входит в тариф →
Работа с файлами и функциями

Загрузка файлов в запрос и вызов функций — две позиции из списка возможностей API.

Входит в тариф →
Мультимодальные модели

Текст и изображения на входе: gemma, qwen3-vl, deepseek-ocr и другие. Моделей, рисующих картинки по описанию, в каталоге не заявлено — мультимодальные модели здесь читают изображения, а не создают их.

Входит в тариф →
Языковые модели

Разработчик разводит линейку по задачам: Alice LLM — «Флагманская модель для сложных задач и чатовых сценариев», Alice AI Flash — «Быстрая языковая модель, оптимизированная под популярные бизнес-задачи», YaGPT Pro — «Мощная модель для задач анализа, генерации контента и RAG-сценариев». Кроме собственных моделей на платформе доступны опенсорсные.

Входит в тариф →