Новый способ обнаружения «галлюцинаций» в языковых моделях

Исследователи из Сколтеха и Центра практического искусственного интеллекта Сбербанка разработали экономически эффективный метод под названием TOHA для выявления «галлюцинаций» в больших языковых моделях, применяемых в системах с дополненной генерацией данных (RAG-системы). Этот подход анализирует топологическую структуру карт внимания модели и позволяет идентифицировать ответы, не поддерживаемые предоставленным контекстом.

Преимущество метода в том, что он не требует обучения дополнительных моделей и использует лишь небольшое количество аннотированных данных для настройки. Это делает его особенно полезным для быстрого и эффективного выявления неуместных или ложных ответов, что может улучшить качество взаимодействия с искусственным интеллектом.