Что предлагает Anthropic
Генеральный директор Anthropic Dario Amodei опубликовал план контролируемого снижения темпа развития передового ИИ. Он не предлагает останавливать обучение моделей: цель — временно ограничить прирост их возможностей, чтобы исследователи успели усилить технические и организационные меры безопасности. [1 · Dario Amodei] [2 · Reuters]
Первым шагом должны стать независимые оценщики, получающие доступ к моделям, данным испытаний и внутренним процессам на уровне сотрудников. Anthropic заявила, что готова внедрить такую практику односторонне, не дожидаясь общего соглашения отрасли. [1 · Dario Amodei] [2 · Reuters]
Как должна работать координация
На втором этапе ведущие лаборатории в демократических странах должны согласовать стандарты и пределы развития моделей; Amodei допускает, что для этого могут понадобиться специальные исключения из антимонопольных правил. Третий этап предполагает международную координацию, включая государства с иными политическими системами, хотя автор признаёт сложность надёжной проверки таких обязательств. [1 · Dario Amodei] [2 · Reuters]
По оценке Amodei, согласованное замедление может дать один-два года для работ по согласованию поведения моделей с намерениями людей, интерпретируемости, испытаниям и операционной безопасности. Его сценарии масштабных атак автономных агентов остаются предупреждением руководителя компании, а не установленным прогнозом. [1 · Dario Amodei] [2 · Reuters] [3 · Associated Press]
Источники
- Dario Amodei — We Must Pace the Frontier — 12 сентября 2026
- Reuters — призыв главы Anthropic замедлить развитие моделей — 12 сентября 2026
- Associated Press — план Dario Amodei и его обоснование — 12 сентября 2026
- NIST — AI Risk Management Framework 1.0 — Методическая основа оценки рисков, 2023
- Armstrong, Bostrom и Shulman — Racing to the Precipice — Теоретическая модель; рабочая версия 2013, журнальная публикация 2016
- Balesni и соавторы — обоснование безопасности по результатам испытаний — Исследовательский препринт, 2024; ограничения доказательств обсуждаются авторами
Комментарий эксперта
Самая существенная часть инициативы — возможность сделать заявления лабораторий проверяемыми. Постоянный доступ внешних оценщиков потенциально уменьшает разрыв между тем, что знает разработчик, и тем, что могут проверить заказчики и общество. Моя оценка: это более осязаемый шаг, чем обещание выиграть определённое число месяцев. Но результат будет зависеть от того, смогут ли проверяющие исследовать неудобные случаи и публиковать выводы, затрагивающие коммерческие интересы компании. [1 · Dario Amodei]
Для конкуренции здесь возможны противоположные последствия. Общие требования могут сделать проверенную безопасность самостоятельным преимуществом и уменьшить выгоду от поспешного выпуска моделей. Однако дорогой допуск на рынок способен укрепить крупнейшие лаборатории. Поэтому я считал бы разумным привязывать глубину проверки к опасным возможностям системы и масштабу её применения. Одинаковые издержки для небольшой прикладной модели и передовой автономной системы могли бы непропорционально ограничить новых участников. [1 · Dario Amodei] [4 · NIST]
Теория игр объясняет, почему добровольной осторожности может не хватить. В модели Armstrong, Bostrom и Shulman участники технологической гонки при определённых предпосылках сокращают меры безопасности ради первенства. Это теоретический механизм, а не доказательство неизбежной катастрофы. Из него я вывожу потребность в проверяемых взаимных обязательствах: обещания должны менять ожидаемые выгоды участников, иначе каждый продолжит опасаться, что осторожностью воспользуется конкурент. [5 · Armstrong, Bostrom и Shulman]
Для клиентов полезным результатом могли бы стать более предсказуемые автоматизированные процессы и меньший ущерб от ошибочных действий. Но замедление исследований само по себе не обеспечивает ни надёжности ответов, ни защиты данных конкретного магазина или банка. Организациям всё равно понадобятся ограничения полномочий, проверка критических операций и разбор происшествий. Эффект следует оценивать по задачам пользователя, включая стоимость исправлений, а не только по результатам общих испытаний модели. [4 · NIST] [6 · Balesni и соавторы]
На мировом уровне инициатива ставит вопрос о том, кто устанавливает приемлемый риск. Amodei сочетает международные договорённости с сохранением технологического преимущества США и союзников. На мой взгляд, это может затруднить доверие между государствами: совместная безопасность и стратегическое соперничество требуют разных стимулов. Более реалистичным первым результатом могли бы стать совместимые процедуры испытаний и обмен сведениями об инцидентах, даже если согласовать общий темп развития не удастся. [1 · Dario Amodei]
Я буду считать инициативу работающей, если появятся независимые отчёты, сведения об ограничениях доступа и примеры решений, изменённых после проверки. Дополнительные сигналы — время устранения выявленных недостатков и повторяемость опасного поведения в сопоставимых испытаниях. Первоначальный рост зарегистрированных инцидентов может означать улучшение выявления, а не ухудшение моделей. Если же замедлятся только публичные выпуски, а внутренние системы останутся непроверяемыми, общественная польза такого режима будет сомнительной. [1 · Dario Amodei] [6 · Balesni и соавторы]