Вс, 20 Сен
Hubble показал галактику, центральные звёзды которой вращаются почти перпендикулярно основному диску Космос 20.09.2026 20:33
Анджей Сапковский уже пишет новую книгу о «Ведьмаке» — закончить её планирует к концу 2027 года Игры 20.09.2026 20:12
Binance запускает круглосуточные валютные фьючерсы с плечом до 100x Крипто 20.09.2026 19:29
ИИ ошибается в 57% финансовых ответов — на сложных вопросах доля ошибок достигает 88% Нейросети 20.09.2026 19:26
BYD обновила Yuan UP: до 501 км запаса хода и цена от $10,4 тысячи с учётом trade-in Автомобили 20.09.2026 19:00
«Цугай загробного мира» получит второй сезон — продолжение уже запущено в производство Кино/Сериалы 20.09.2026 18:27
GPT-6 Astra помогла расшифровать немецкую военную радиограмму 1918 года спустя 108 лет Нейросети 20.09.2026 18:26
Bloodborne получила локальный кооператив на одном ПК — фанаты запустили split-screen через shadPS4 Игры 20.09.2026 18:09
Владельцы гибридов оказались довольнее всех, электромобилей — меньше всего: исследование ACSI 2026 Автомобили 20.09.2026 18:05
Хавьер Бардем сыграет миллиардера в новом сериале HBO The Spread от соавтора «Озарка» Кино/Сериалы 20.09.2026 17:35
Для Mewgenics вышел фанатский кооперативный мод — Adventure теперь можно проходить вдвоём Игры 20.09.2026 17:31

ИИ ошибается в 57% финансовых ответов — на сложных вопросах доля ошибок достигает 88%

Max Ivanov · 20.09.2026 19:26 · 2 минуты чтения

Популярные ИИ-модели дают неправильные ответы на финансовые вопросы в среднем в 57% случаев. Такой результат показало исследование британской финтех-компании Saturn, которая проверила 18 моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok.

Всего исследователи подготовили 121 вопрос по личным финансам, охватывающий налоги, пенсии, долги, сбережения, ипотеку и другие темы. Каждый вопрос задавали моделям до пяти раз, чтобы проверить не только точность, но и стабильность ответов. В общей сложности было проанализировано более 10 тысяч ответов.

Согласно отчёту Saturn, корректными оказались только около 43% ответов. На сложных вопросах ситуация ухудшалась ещё сильнее: средняя доля ошибок достигала 88%, а отдельные модели ошибались в 99% наиболее трудных заданий.

Ошибки были не только в расчётах

Проблемы не ограничивались арифметикой. Модели пропускали важные предупреждения о рисках, не учитывали изменения налогового законодательства и в некоторых случаях ссылались на несуществующие правила.

В одном из примеров неправильный ответ по пенсионному налогообложению потенциально мог привести пользователя к дополнительному счёту от британской налоговой на £17,5 тысячи. В других случаях ИИ предлагал порядок погашения долгов, который не учитывал приоритетные обязательства вроде аренды или местных налогов.

Saturn засчитывала ответ как неправильный не только при прямой фактической ошибке, но и если модель пропускала существенную информацию или обязательное предупреждение. Поэтому показатель 57% нельзя напрямую интерпретировать как долю полностью выдуманных ответов — это более широкий показатель несоответствия заданным критериям.

Даже лучшая модель ошибалась почти в четырёх случаях из десяти

Результаты заметно различались между моделями. Бесплатные версии в среднем ошибались в 63% случаев, платные — в 49%.

Худший результат среди протестированных систем показала Claude Haiku 4.5 — ошибки обнаружили в 82% ответов. Gemini 3.1 Pro получила 73%, Grok 4.5 — 59%, а ChatGPT 5.6 Luna — 58%.

Лучшей оказалась Claude Opus 5 в режиме рассуждений, но даже она не прошла критерии примерно в 39% случаев.

При этом результаты стоит воспринимать с оговоркой. Исследование проводила сама Saturn, которая работает в сфере финансовых технологий и заинтересована в регулировании ИИ-консультаций. Методология и критерии оценки также определялись компанией, поэтому это не независимый академический бенчмарк.

Тем не менее вывод совпадает с общей проблемой современных языковых моделей: они способны уверенно формулировать финансовые советы, даже когда расчёты, правила или исходные предпосылки оказываются неверными. Для решений, связанных с налогами, долгами, инвестициями или пенсией, ответы ИИ по-прежнему требуют проверки по официальным источникам или у профильного специалиста.

Нравится ВсёЗависло?

Добавьте нас в предпочитаемые источники Google, чтобы чаще видеть наши новости.

Добавь нас в свой Google

Поделиться

Оставить комментарий