AI05

Vision Foundation Models & Multimodal AI

Длительность обучения: 5 дней

Записаться на курс

Описание
курса

Материал данного курса посвящен современным foundation‑моделям компьютерного зрения и мультимодальным моделям (VLM): zero‑shot детекции и сегментации, визуальному вопросно‑ответному анализу, доменной адаптации, видеоаналитике и развёртыванию на edge‑устройствах и в высоконагруженном облаке.

Аудитория курса

Инженеры компьютерного зрения, ML‑инженеры, команды Document AI, производственные и ритейл‑команды контроля качества мониторинга.

Предварительные требования

Как устроено
обучение

Онлайн-курс

Онлайн-курс предполагает групповые занятия с инструктором через систему видеоконференцсвязи, кроме того, домашние задания и экзамен. Слушателям предоставляются учебные пособия и дополнительные материалы

Для корпоративных клиентов

Обучение для корпоративных клиенов включает в себя онлайн-курсы и курсы самообучения, а также дополнительные сервисы,необходимые корпоративным клиентам: организация планов обучения для подразделений клиента, проведение оценки эффективности обучения и т.д.

программа
курса

• Универсальные визуальные бекбоны (DINOv3, SigLIP‑2) как экстракторы признаков.
• Open‑vocabulary детекция (OWLv3, Grounding DINO 2) и поиск объектов по текстовому описанию без дообучения.
• Иерархическая сегментация Segment Anything 3 и видеотрекинг масок.
• Построение пайплайна автоматической разметки данных.
• Архитектура современных VLM и роль визуальных проекторов.
• Извлечение данных из документов, чертежей и пользовательских интерфейсов в логике Document AI.
• Spatial reasoning: понимание координат, расстояний и относительного расположения объектов.
• Проектирование мультимодального пайплайна под доменный кейс слушателя.
• Parameter‑efficient методы (LoRA, DoRA) для vision‑бекбонов и мультимодальных проекторов.
• Дообучение декодеров сегментации под специфические объекты предметной области.
• Ускоренное обучение VLM с помощью Unsloth и оптимизация потребления VRAM.
• Синтетические данные через диффузионные модели для расширения обучающих корпусов.
• Long‑context video understanding и работа с длинными видеопотоками.
• Устойчивый трекинг при перекрытиях с помощью современных моделей трекинга.
• Распознавание действий и понимание намерений через рассуждения модели.
• Системы событийного мониторинга на примерах промышленной безопасности.
• Низкобитная квантизация (4‑bit, тернарные представления) для запуска VLM на ограниченном оборудовании.
• Оптимизация мультимодальных цепочек через ONNX и TensorRT‑LLM.
• Speculative decoding для ускорения генерации описаний.
• Упаковка модели под целевое устройство и измерение FPS, латентности и энергопотребления.

Варианты
покупки курса

индивидуальное

Стоимость курса — 121 296,00 ₽

Групповые онлайн-занятия

Бессрочный доступ ко всем материалам

Живые вебинары с преподавателем

Домашние задания

Экзаменация с выдачей сертификата

Для уточнения даты проведения курса, пожалуйста, заполните форму.

Оставить заявку

*Нажимая на кнопку, вы соглашаетесь с публичной офертой и политикой конфиденциальности

корпоративное

Стоимость курса от 121 296,00 ₽

Для получения данных о конечной стоимости и уточнения даты проведения курса, пожалуйста, заполните форму.

Оставить заявку

*Нажимая на кнопку, вы соглашаетесь с публичной офертой и политикой конфиденциальности