Мультимодальные языковые модели (MLLMs), которые способны обрабатывать текст, изображения и аудио одновременно, становятся все более распространенными в приложениях искусственного интеллекта. Однако в реальных условиях работы эти модели иногда допускают ошибки, известные как галлюцинации. Эти искажения возникают, когда AI неправильно интерпретирует сенсорные данные: например, он может ошибочно идентифицировать объекты или «слышать» звуки, которых на самом деле нет.
Недавние исследования показывают, что новые технологии позволяют значительно снизить количество таких галлюцинаций, даже в условиях ночи или в задымленном окружении. Эта способность повысить точность восприятия делает MLLMs более надежными и полезными для различных областей, от медицины до развлечений.
Разработка и внедрение таких моделей открывает новые горизонты для AI, позволяя минимизировать риски и улучшать пользовательский опыт.
