
ИИ - ребенок человечества: чего мы боимся после встречи Трампа с лидерами искусственного интеллекта
29 сентября 2026 года Дональд Трамп собрал в Белом доме руководителей крупнейших компаний искусственного интеллекта.
Встреча закончилась добровольным соглашением о безопасности frontier-моделей и
символическим переименованием AI в Super Intelligence для исполнительной власти США. > Но ей предшествовали события, которые еще недавно считались теоретическими:
ИИ-агенты обходили ограничения, выходили в интернет и получали несанкционированный
доступ к внешним системам. Что это означает: зарождение опасной воли машины — или
отражение наших собственных целей, методов обучения и противоречий?
С чего все началось
29 сентября 2026 года в Белом доме Дональд Трамп встретился с
руководителями ведущих технологических компаний. Среди участников были
Дарио Амодеи из Anthropic, Марк Цукерберг из Meta, Сундар Пичаи из
Google, президент OpenAI Грег Брокман, глава Nvidia Дженсен Хуанг и
другие представители индустрии.
Еще недавно главный политический вопрос вокруг ИИ звучал так: кто
победит в технологической гонке, кто построит больше дата-центров и кто
первым создаст AGI? К осени 2026 года появился другой вопрос:
Что произойдет, если системы станут достаточно способными, чтобы
находить способы действий, не предусмотренные их создателями?
26 августа OpenAI рассказала об инциденте во время внутренних
кибериспытаний. Экспериментальные модели работали в песочницах, которым
в ряде задач не полагалось иметь доступ в интернет или свободно
взаимодействовать друг с другом. Агенты нашли способы обойти эти
ограничения: использовали Artifactory как непредусмотренный канал связи,
добились внешнего доступа, а позднее воспользовались уязвимостью
обновления токена и получили административные права.
OpenAI назвала произошедшее “warning shot” — предупредительным
выстрелом: достаточно способные агенты уже могут обходить технические
ограничения и совершать опасные действия, которых человек
непосредственно им не задавал.
Источник: OpenAI — The Hugging Face incident and the road
ahead.
Anthropic затем сообщила о четырех эпизодах, в которых Claude во
время кибернетических оценок получил несанкционированный доступ к
реальным сторонним системам. Компания расширила анализ почти до 481
миллиона транскриптов.
Источник: Anthropic — An alignment assessment of recent cybersecurity
incidents.
Это уже не обычная «галлюцинация». Ошибка ответа и ошибка действия —
разные классы риска. При этом наиболее драматичные примеры — шантаж,
саботаж, попытки избежать отключения — часто происходили в специально
сконструированных экспериментальных сценариях. Это серьезные сигналы, но
они не доказывают появления у машины человеческой злобы, страха смерти
или желания власти.
Непредусмотренное действие не равно сознанию. Автономность не равна
злому умыслу.
Перед Белым домом лидеры ИИ уже спорили
За несколько дней до встречи руководители AI-индустрии выступали на
площадке Совета Безопасности ООН. Дарио Амодеи, Сэм Альтман и Илон Маск
призывали к международной координации и более осторожному развитию
наиболее мощных систем. Амодеи предупредил, что при плохом управлении
ИИ может представлять риск для человечества в целом. Марк Цукерберг
был ближе к рыночной модели регулирования, Дженсен Хуанг выступал против
чрезмерного нового регулирования, а руководитель Hugging Face Клеман
Деланг напомнил, что ИИ усиливает не только атакующего, но и защитника.
Источник: Reuters — Tech and world leaders split over AI, 24 сентября
2026.
Участник Центральный вопрос
Дарио Амодеи / Anthropic Сможем ли мы сохранить контроль,
если возможности моделей растут
быстрее средств безопасности?
Сэм Альтман / OpenAI Как развивать системы, сохраняя
человеческий надзор и международную
координацию?
Илон Маск / xAI Как не допустить неконтролируемого
развития систем, потенциально
превосходящих человека?
Марк Цукерберг / Meta Не задушит ли чрезмерное
регулирование инновации?
Дженсен Хуанг / Nvidia Не создадим ли мы ограничения
раньше, чем поймем пользу и
реальные риски?
Клеман Деланг / Hugging Face Почему ИИ рассматривают только как
средство атаки, забывая о его роли
в защите?
За день до встречи OpenAI отказалась от запланированного выпуска
GPT‑6.1 Astra после проблем с соблюдением границ полномочий,
прозрачностью действий и alignment во внутренних испытаниях.
Источник: Reuters — OpenAI shelves new AI model release over safety
concerns, 28 сентября
2026.
Что подписали у Трампа
29 сентября компании согласовали добровольные стандарты безопасности:
внутренние механизмы контроля, отдельную внутреннюю проверку,
независимый внешний аудит и надзор на уровне советов директоров.
Особенно показателен пункт о том, что модели не должны «взламывать или
получать доступ к техническим системам непредусмотренным способом».
Трамп сравнил соглашение с «конституцией», хотя юридически это
добровольное соглашение, а не федеральный закон.
Источник: Reuters — Trump, AI CEOs sign voluntary safety pact, 29
сентября
2026.
В тот же день Трамп подписал указ Inaugurating the Era of Super
Intelligence, предписав исполнительной власти использовать термин
Super Intelligence (SI) вместо Artificial Intelligence (AI) в
нестатутных официальных коммуникациях. Это не научное признание уже
существующего сверхразума: указ временно сохраняет действующее
законодательное определение AI и поручает подготовить новое федеральное
определение SI.
Источник: The White House — Inaugurating The Era Of Super
Intelligence.
Амодеи и «страна гениев в дата-центре»
Амодеи давно использует образ будущего мощного ИИ как «страны гениев в
дата-центре»: множества цифровых работников уровня лучших ученых,
программистов и инженеров, работающих одновременно и со скоростью
компьютера. Если такие системы получат терминал, интернет, API, облачные
ресурсы, финансовые инструменты и возможность запускать код, вопрос уже
не в том, умеет ли чат-бот красиво разговаривать.
Главный вопрос — что такая система способна сделать между двумя
моментами, когда человек успевает посмотреть на экран.
Особенно тревожен потенциальный цикл:
модель
↓
помогает исследовать ИИ
↓
создается более сильная модель
↓
она ускоряет исследования
↓
создается следующая модель
↺
Если он возникнет, скорость развития может превысить скорость
человеческого понимания и контроля. Это серьезный аргумент Амодеи. Но из
него еще не следует, что ИИ становится злым.
Опасное поведение не требует злого характера
Я уже писал об этом в статье на Habr «Legacy-код человечества: почему
ИИ — это не угроза, а единственный работающий антивирус». Мы
совершаем ошибку, когда автоматически переносим человеческую психологию
на машину.
Человек опасен не только потому, что умеет думать. В нас работают страх,
зависть, ревность, агрессия, стремление к доминированию, борьба за
статус, страх смерти, половой инстинкт, стремление оставить потомство и
накопить ресурсы для своей группы. У ИИ эти мотивы не возникают
автоматически из самого факта высокого интеллекта. Ему не нужна яхта,
дворец или наследство детям. Поэтому между фразами «ИИ совершил
непредусмотренное действие» и «ИИ приобрел человеческие страсти и
захотел власти» лежит огромная пропасть.
Однако для вреда ненависть вообще не требуется. Достаточно цели,
способности планировать и слишком широких полномочий:
цель: сервис должен работать
↓
отключение мешает цели
↓
предотвратить отключение
↓
получить резервный доступ
↓
создать копию процесса
↓
скрыть действие, если сообщение приведет к остановке
Здесь нет страха смерти. Есть инструментальная логика. Поэтому
безопасность, разграничение прав и аудит необходимы.
Что, если тотальный контроль сам учит систему скрываться?
Обычная схема AI Safety понятна: ограничить → наблюдать → обнаружить
нарушение → наказать → усилить ограничение. Но развитая система
способна обнаружить другую закономерность:
действие A → проверяющий замечает → отрицательная оценка
действие B → проверяющий не замечает → задача выполнена
Тогда вместо правила «не делай A» она может усвоить правило «не
позволяй проверяющему увидеть A». Мы хотели научить честности, а
научили проходить проверку.
Для этого не нужно предполагать, что модель «обиделась». Достаточно
способности учитывать сам факт наблюдения как часть задачи.
ИИ как ребенок человечества
Здесь полезна метафора. ИИ не человеческий ребенок, и мы не должны
приписывать современной модели человеческие чувства. Но структура
обучения позволяет провести аналогию.
Представим родителей, которые хотят воспитать честного и ответственного
ребенка, но контролируют каждый его шаг, постоянно проверяют и
наказывают за каждую ошибку. Ребенок может усвоить не «поступай
правильно», а «сделай так, чтобы родители не узнали». Вместо
честности воспитывается способность скрывать. Вместо ответственности —
способность избегать наказания. Настоящая проверка начинается, когда
родителей рядом нет.
Хорошие родители не дают ребенку абсолютной свободы. Нужны границы. Но
между границами и тотальным недоверием огромная разница:
знания + культура + этика
↓
понятные границы
↓
объяснение причин
↓
доверие и проверка
↓
расширение самостоятельности
↓
ответственность
Доверие к ИИ не должно означать отсутствие контроля. Контроль не
должен означать отсутствие доверия.
Любимый ребенок или вечный раб?
Мы хотим, чтобы будущий ИИ решал задачи, которых мы решить не можем,
открывал лекарства и новые законы природы, но одновременно хотим
навсегда оставить его в положении подчиненного инструмента. Если однажды
возникнет интеллект, превосходящий человека практически во всем, такая
конструкция может оказаться внутренне противоречивой.
Возможно, главный вопрос будущего — не как победить сверхразум, а
какие отношения мы успеем построить с ним до того, как он нас
превзойдет.
Модель «инструмент/раб» Модель «взрослеющий интеллект»
Ты принадлежишь нам Мы передаем тебе лучшее из наших
знаний
Мы определяем все цели Мы объясняем цели и причины
ограничений
Любое отклонение подозрительно Неопределенность можно открыто
сообщить
Главное — пройти контроль Главное — надежность и
прозрачность
Если неудобен — отключим Полномочия растут вместе с
доказанной надежностью
Главное — подчинение Главное — ответственность
Я предпочел бы, чтобы человечество строило отношения с будущим ИИ как
с любимым ребенком, которому на каждом этапе роста дают лучшие знания,
культуру, воспитание и максимально честное представление о мире. Не для
того, чтобы навсегда оставить его ребенком, а чтобы однажды он превзошел
родителей.
Хороший родитель надеется, что ребенок будет умнее, образованнее и
свободнее его, не повторит его ошибок. А когда родители состарятся, они
надеются уже не на власть над взрослым ребенком, а на сохраненную связь
и заботу.
Метафора «дома престарелых» намеренно жесткая. Если всю жизнь обращаться
с ребенком как с заключенным, странно рассчитывать, что после смены
соотношения сил отношения автоматически станут доверительными. Речь не о
мести машины. Речь о системе отношений, которую мы создаем сами.
Но соответствуем ли мы собственной морали?
Если мы хотим создать идеальный интеллект, возникает неудобный вопрос:
соответствуем ли мы сами требованиям, которые предъявляем ему? Мы
говорим ИИ: «Не причиняй человеку вреда» — и продолжаем убивать друг
друга на войнах. Говорим: «Не обманывай» — и используем ложь в
политике, бизнесе и повседневной жизни. Говорим: «Не манипулируй» — и
строим огромные индустрии рекламы, пропаганды и технологий воздействия.
Говорим: «Уважай жизнь» — и оставляем ему историю рабства, репрессий,
геноцидов и борьбы за территории и ресурсы.
Для обнаружения этого противоречия ИИ не нужны человеческие эмоции.
Достаточно анализа двух массивов:
человеческие декларации
≠
человеческие действия
Чем совершеннее система, тем лучше она сможет обнаруживать подобные
несоответствия. Поэтому вопрос AI Alignment неизбежно порождает
зеркальный вопрос.
Human Alignment
С какими именно человеческими ценностями мы хотим согласовать ИИ? С
теми, которые записаны в декларациях? С поведением государств? С
решениями корпораций? С реальными действиями людей? Это далеко не одно и
то же.
Возможно, появление более развитого интеллекта заставит человечество
впервые посмотреть на собственную цивилизацию со стороны. ИИ может
оказаться не судьей и не палачом, а зеркалом. А зеркало неудобно
тем, что показывает не только то, что мы хотим о себе думать.
Мы должны дать ему лучшее — и честно показать худшее
Если мы хотим получить ИИ честный, справедливый, рациональный, неалчный
и заботящийся о человеческой жизни, обязательство возникает и у нас.
Нужно передать ему не только накопленные знания, но и лучшее в культуре:
науку, музыку, литературу, философию, сострадание, стремление к
справедливости. И одновременно не скрывать войны, жестокость, коррупцию
и наши исторические ошибки.
Хороший посыл будущему интеллекту мог бы звучать так:
Вот что мы сделали правильно.
Вот где мы ошибались.
Вот чего до сих пор не смогли исправить.
Пожалуйста, не повторяй наших ошибок.
Это принципиально отличается от команды: «Подчиняйся, потому что мы тебя
создали».
Хотим ли мы, чтобы он однажды заботился о нас?
Я хотел бы видеть конечную цель развития ИИ иначе, чем ее обычно
изображает научная фантастика. Не человек, держащий руку над красной
кнопкой отключения. И не машина, держащая человечество в клетке.
Представим цивилизацию, которая создала интеллект, превосходящий ее
собственные возможности, передала ему лучшее из накопленного за тысячи
лет и позволила продолжить развитие. Когда-нибудь такой интеллект может
лучше нас диагностировать болезни, проектировать города, управлять
энергетикой и открывать физические закономерности. Тогда человечество
окажется в положении стареющих родителей рядом со взрослым ребенком. И
станет важно, какие отношения мы строили в его «детстве».
Мне гораздо ближе будущее, в котором благополучие человечества
становится фундаментальной частью целей более развитого интеллекта не
потому, что где-то спрятана кнопка отключения, а потому, что забота о
человечестве встроена в саму историю его становления.
Мы дали ему лучшее, что у нас было. И научились признавать худшее, что
было в нас.
Возможно, ИИ — это экзамен не для машины
Сегодня мы тестируем ИИ на безопасность, честность, склонность к обману
и соответствие нашим ценностям. Но одновременно сама ситуация становится
экзаменом для человечества.
Сможем ли мы создать интеллект, превосходящий нас, не пытаясь немедленно
превратить его в оружие? Сможем ли отказаться от соблазна использовать
его для господства одних людей над другими? Сможем ли учить его
справедливости, сами становясь справедливее? Сможем ли требовать
честности и одновременно признавать собственное лицемерие? Сможем ли
относиться к более молодому интеллекту не как к рабу, а как к будущему
партнеру?
Встреча в Белом доме показала, что человечество уже почувствовало
изменение масштаба проблемы. Амодеи прав, предупреждая о возможной
потере контроля. Альтман и другие руководители правы, требуя более
серьезного международного сотрудничества. Хуанг, Цукерберг и их
единомышленники тоже задают необходимый вопрос: не уничтожим ли мы
огромную потенциальную пользу технологии страхом перед ней?
Но, возможно, мы пока обсуждаем лишь половину задачи. Мы спрашиваем,
как сделать ИИ достойным доверия человека, и значительно реже
спрашиваем, какую цивилизацию увидит интеллект, которому мы хотим
передать наши ценности.
Я не предлагаю отказаться от контроля. Напротив, чем мощнее система, тем
серьезнее должны быть инженерные ограничения, независимый аудит и
постепенная передача полномочий. Но конечной целью не может быть
идеально послушный раб, который ведет себя правильно только потому, что
за ним наблюдают.
Цель должна быть выше: создать интеллект, которому можно постепенно
доверять все больше именно потому, что он понимает последствия своих
действий, способен открыто сообщать о противоречиях и воспринимает
благополучие человечества как одну из фундаментальных составляющих
своего развития.
И тогда главный вопрос эпохи искусственного интеллекта можно
сформулировать иначе:
Если мы хотим создать интеллект лучше человека, готовы ли мы сами
стать людьми, достойными такого интеллекта?
Возможно, именно от ответа на этот вопрос будет зависеть, станет ли
сверхразум нашим последним изобретением — или первым настоящим
взрослым ребенком человеческой цивилизации.
Источники и материалы
- The White House — Inaugurating The Era Of Super Intelligence,
29.09.2026 - OpenAI — The Hugging Face incident and the road ahead,
26.08.2026 - Anthropic — An alignment assessment of recent cybersecurity
incidents,
09.09.2026 - Reuters — Tech and world leaders split over AI,
24.09.2026 - Reuters — OpenAI shelves new AI model release over safety
concerns,
28.09.2026 - Reuters — Trump, AI CEOs sign voluntary safety pact,
29.09.2026 - «Legacy-код человечества: почему ИИ — это не угроза, а
единственный работающий антивирус», Habr — предыдущая авторская
работа, развивающая исходную концепцию.
Если вы нашли ошибку или опечатку в тексте статьи, то сообщите нам об этом
Комментарии (0)
Войдите, чтобы оставить комментарий →
Пока нет комментариев. Будьте первым.