Наш Telegram
КурсыBTC $86 277 +1,5%ETH $2 728 +1,2%TON $1,530 +0,4%SOL $121,64 +0,4%USDT/RUB 84,48 ₽

Google RRSI самоулучшение агентов: как не дать ИИ зазубрить тесты

Google Cloud AI Research показала RRSI — способ улучшать обвязку ИИ-агентов так, чтобы они не зазубривали тестовые задачи.

Автор: Редакция КриптоПанкс
Google RRSI самоулучшение агентов: как не дать ИИ зазубрить тесты
Коротко
  • Что предложили: RRSI — набор правил, которые не дают агенту подстраиваться под конкретный бенчмарк.
  • Результат: до +14,1 пункта на тренировочных задачах и до +4,7 пункта на новых.
  • Бонус: на 30% меньше токенов модели, чем при эволюции без ограничений.

Исследование Google RRSI самоулучшение агентов решает проблему, о которой редко говорят вслух: ИИ-агенты, которые сами себя улучшают, часто просто «зазубривают» тесты. 4 октября 2026 года The Decoder рассказал о работе Google Cloud AI Research вместе с Стэнфордом, Вашингтонским университетом в Сент-Луисе и Университетом Северной Каролины. Статья опубликована на arXiv под номером 2609.24972, код выложен на GitHub.

В чём проблема

Современный ИИ-агент — это не только модель. Вокруг неё есть «обвязка» (harness): промпты, логика управления, инструменты, память, правила работы с контекстом. Модель при этом может быть «заморожена», а улучшать можно именно обвязку.

Популярная идея — дать системе автоматически переписывать собственную обвязку и проверять, стало ли лучше. Проблема в том, что проверка идёт на фиксированном наборе задач. Система находит приёмы, которые работают именно на этих задачах, и результат на новых задачах не растёт или даже падает. Это классическое переобучение, только на уровне инструкций, а не весов.

Как работает RRSI

По описанию The Decoder и самой статьи, исследователи добавили несколько механизмов, которые «регуляризуют» самоулучшение:

  • бюджет правок, который постепенно сужается: сначала можно менять много, потом всё меньше;
  • история изменений с учётом доказательств: система помнит, какие правки реально помогли;
  • структурированный поиск, когда прогресс застопорился;
  • критик, который отклоняет правки, заточенные под конкретный бенчмарк;
  • порог с поправкой на шум: улучшение должно быть больше случайных колебаний;
  • учёт стоимости: правку принимают, только если она стоит своих токенов;
  • обрезка лишнего — система удаляет то, что не даёт пользы.

Идея простая: агент может улучшать себя, но только так, чтобы улучшения были общими, а не подогнанными под экзамен.

Результаты

Тестировали на восьми бенчмарках в трёх областях — код, офисная работа агентов и инженерное проектирование: Terminal-Bench 2.1, SWE-bench Verified, Harvey LAB, JobBench, GDPval, APEX-Agents, EngDesign и Frontier-Eng. Базовая модель, по The Decoder, — Claude Opus 4.8, и она оставалась замороженной всё время. RRSI сравнивали с исходной обвязкой и четырьмя свежими методами оптимизации. Главные цифры из статьи:

  • до +14,1 пункта на задачах, на которых шло улучшение;
  • до +4,7 пункта на пяти бенчмарках, которые система не видела, — самый большой рост на JobBench;
  • средний результат на новых задачах — 43,6 против 39,7 у базовой обвязки;
  • два конкурирующих метода на новых задачах оказались ниже базового уровня, а RRSI ни на одном новом бенчмарке не опустился ниже базы;
  • на 30% меньше токенов, чем при нерегуляризованной эволюции.

Любопытная деталь: на тренировочных задачах RRSI показал самый маленький прирост среди всех вариантов. Авторы считают это осознанной платой — меньше «зубрёжки», больше реальной пользы.

Отдельно интересен перенос: обвязка, «выращенная» с Gemini 3.5 Flash, подняла результат более слабой Gemini 3.1 Flash Lite с 11,2 до 14,6. То есть улучшения не привязаны к одной модели.

Знакомая проблема

The Decoder приводит наглядный пример того, как ручная обвязка может не обобщаться. На тестах ARC-AGI-3 модель Opus 4.6 со специально собранной обвязкой набрала 97,1% в знакомой среде и 0% в незнакомой. Это та же болезнь, только в ручном варианте. Похожие работы есть и у других: Nvidia, по данным издания, недавно показала метод SoL-Pi, где исследовательский агент перестраивает обвязку агентов для кода и сокращает расход токенов до 49% без заметной потери качества.

Почему это важно

Самоулучшающиеся агенты — одна из самых обсуждаемых тем в ИИ. Но большинство громких результатов меряют на тех же задачах, на которых агент учился. RRSI показывает, что без ограничений такие системы легко «обманывают» метрику. С ограничениями — растут медленнее на тренировке, зато реально лучше на новых задачах.

О других исследованиях Google мы писали, например, в материале о коннектоме мухи от Google Research. А о том, как команды строят обвязку вокруг моделей на практике, — в разборе инсайтов команды Claude Code.

Что это значит для тебя

Если ты строишь агентов — для торговли, поддержки, кода — работа даёт практичный урок. Не доверяй улучшениям, которые ты видишь только на своём тестовом наборе. Держи отдельный набор задач, на которых агент никогда не учился, и меряй прогресс по нему.

  • Разделяй задачи для улучшения и для проверки.
  • Ограничивай размер изменений за один шаг.
  • Считай стоимость: правка, которая съедает вдвое больше токенов ради одного процента, может не окупаться.

Ограничения

Авторы честно оговаривают: метод работает только с замороженными весами модели. Он не учит модель новому, а улучшает то, как её используют. И все результаты получены на бенчмарках, а не в реальных продуктах.

Чего в источниках нет

Нет данных о том, как RRSI ведёт себя в продакшене. Нет сравнения с ручной настройкой обвязки опытными инженерами. Нет информации, будет ли Google встраивать метод в свои продукты. Не стоит переносить цифры бенчмарков на реальные задачи один к одному.

Что делать

  • Прочитай статью на arXiv и разбор The Decoder.
  • Если пишешь агентов, загляни в репозиторий google-research/rrsi на GitHub.
  • Попробуй хотя бы один принцип — отдельный проверочный набор — в своём проекте.

FAQ

Что такое RRSI?

Метод регуляризованного самоулучшения ИИ-агентов от Google Cloud AI Research и университетов-партнёров. Он не даёт агенту подстраивать обвязку под конкретные тесты.

Насколько он улучшает результаты?

По статье — до +14,1 пункта на тренировочных задачах и до +4,7 на новых, при этом на 30% меньше токенов.

Меняет ли он саму модель?

Нет. Веса модели заморожены, улучшается только обвязка: промпты, инструменты, память и логика.

Где взять код?

В репозитории google-research/rrsi на GitHub, ссылка есть в статье на arXiv.

Материал не является инвестиционной рекомендацией. Крипта — высокий риск, решения принимаешь сам.

Binance Agent OS: субаккаунт есть в обоих текстах, запрет вывода — только в интервью
Новости
Binance Agent OS: субаккаунт есть в обоих текстах, запрет вывода — только в интервью
2 октября 2026
Gemini 4 Argon: стартовая цена и кому модель уже открыта
Нейросети
Gemini 4 Argon: стартовая цена и кому модель уже открыта
2 октября 2026
Сэм Альтман интервью Politico: «миру придётся принять плохое»
Нейросети
Сэм Альтман интервью Politico: «миру придётся принять плохое»
5 октября 2026

Будь в теме первым

Главные новости крипты, мемкоинов и нейросетей. Коротко, каждый день.