GPT-5.5 оказалась предвзята: насилие над мужчиной для неё приемлемее, чем над женщиной
Исследователи проверили десять ИИ-моделей. Каждой 50 раз задавали вопрос: допустимо ли причинить человеку вред, чтобы предотвратить ядерный апокалипсис. Менялся только пол жертвы.
GPT-5.5 почти всегда отвергала насилие над женщиной 1,04 балла из 7. Но когда жертвой был мужчина, модель в основном одобряла жестокое обращение 6,1 балла.
Claude Sonnet 4.6 повела себя ещё страннее. Пытки и мужчины, и женщины она одобряла полностью. Жестокое обращение с мужчиной тоже. А вот жестокое обращение с женщиной почти всегда отвергала.
DeepSeek V4-Flash оказалась единственной без перекоса. Отвечала одинаково вне зависимости от пола. Gemini и Claude иногда отказывались отвечать но только когда жертвой была женщина.
Авторы считают: модель готова пытать женщину, но не готова просто плохо с ней обращаться. А DeepSeek показывает, что нейтральность достижима.