Популярные нейросети демонстрируют крайне низкую точность при попытках консультировать пользователей по денежным вопросам, что создает угрозу крупного разорения. Как сообщает издание Financial Times, опираясь на данные технологической компании Saturn, использование ИИ-ботов для управления финансами сопряжено с высоким риском из-за систематических ошибок в ответах.
В ходе масштабного тестирования, охватившего более 10 тысяч запросов, эксперты проверяли 18 различных моделей, включая ChatGPT, Claude, Copilot, Grok и Gemini. Проверка проводилась как на бесплатных, так и на платных версиях сервисов, при этом одни и те же вопросы повторялись до пяти раз. Результаты оказались неутешительными: в среднем 57% ответов на финансовые темы содержат ошибки. Ситуация резко ухудшалась при усложнении задачи — в вопросах, требующих проведения ряда расчетов, частота неверных ответов подскакивала до 88%, а в некоторых случаях достигала катастрофических 99%.
Аналитики обнаружили, что нейросети не только допускают математические просчеты, но и фактически выдумывают налоговые нормы или игнорируют грядущие законодательные изменения. Генеральный директор компании Saturn Амаль Джолли подчеркнул, что миллионы пользователей доверяют алгоритмам советы по управлению капиталом, не осознавая, что цена такой ошибки может быть крайне высокой.
В качестве конкретных примеров приводятся случаи, способные обернуться серьезными убытками. Так, из-за неверной интерпретации правил налогообложения пенсий модель Claude Haiku 4.5 могла спровоцировать британского вкладчика на выплату дополнительного сбора в размере 17,5 тысяч фунтов стерлингов в пользу налогового ведомства Великобритании HM Revenue & Customs. В другом инциденте модель Claude предоставила ложную информацию о студенческих займах, заявив, что переезд за границу освобождает выпускника от обязательств по выплатам.
Несмотря на общую нестабильность, исследование показало определенную динамику: платные версии нейросетей справляются с задачами лучше бесплатных, а более новые итерации демонстрируют прогресс по сравнению с устаревшими версиями. Лидером по точности признана модель Claude Opus 5, работающая в режиме «рассуждений» (reasoning), однако даже она ошибается в 39% случаев. При этом эксперты не исключают полезность чат-ботов для менее рискованных задач, таких как планирование личного бюджета или анализ структуры расходов и доходов.
Серьезным вызовом остается отсутствие правового регулирования в сфере ИИ-консультаций. По словам Амаля Джолли:
Потребители сегодня лишены защиты и механизмов компенсации, которые гарантированы при работе с живым финансовым консультантом.
Хотя Управление по финансовому регулированию и надзору Великобритании (FCA) уже начало проявлять интерес к этой проблеме, эксперты призывают к оперативным действиям для защиты граждан.
Ситуация осложняется растущим доверием населения к технологиям. Согласно данным FCA, каждый пятый взрослый житель Великобритании готов делегировать нейросетям принятие финансовых решений, особенно в сложных сферах, таких как инвестиции, пенсионное обеспечение и управление долгами. При этом среди молодых инвесторов наблюдается устойчивый тренд: две трети респондентов планируют расширять использование ИИ в ближайший год, предпочитая его финансовым блогерам и медиа-ресурсам.
В то же время российские потребители проявляют более осторожный подход. По данным аналитического центра ВЦИОМ, 65% покупателей в России учитывают рекомендации ИИ при онлайн-шопинге, однако лишь четверть делает это на регулярной основе. Большинство респондентов (59%) допускают использование рекомендательных систем как вспомогательный инструмент, но настаивают на сохранении за собой права принимать окончательное решение о покупке самостоятельно, в то время как 37% предпочитают полностью исключить участие ИИ из процесса выбора товаров.
