Неделя вышла про то, как перестать строить своими руками всё вокруг агента. В «LLM под капотом» пишут, что ручная сборка пайплайнов почти ушла: берут отлаженную архитектуру агента и подключают к своей задаче, причём в бизнес-задачах США и Европы чаще всего берут Codex. Оттуда же вторая мысль, которая бьёт по backend напрямую: код превращается в расходник, потому что AI удешевил разбор чужих бинарей и сборку эксплойтов, и «работает, не трогаем» перестало быть стратегией. Глеб Кудрявцев подтверждает тот же сдвиг с другой стороны: код он не читает, а расспрашивает модель про потоки данных, и советует выкинуть спеки с консилиумами ради ванильного агента. Из прикладного: GPT 5.6 Sol подешевела на три месяца, но порог в 272k токенов, за которым входные токены дорожают вдвое, никуда не делся. А скилл, вытащивший Opus 5 на ARC AGI 3 с 30% до 100%, устроен просто, и потому его легко перенести к себе: жёсткая проверка зашита в сам тул-колл, а не в промпт.
⚡
Главные практические выводы
01
Брать готовый harness агента вместо своего LLM-пайплайна
Обвязка промптами и RAG вокруг сырого API почти ушла из практики: команды берут доказанную архитектуру агента и подключают её к своей задаче. В бизнес-задачах США и Европы, по наблюдению автора, чаще всего берут OpenAI Codex, Claude — заметно реже.
Почему важно: три года назад стабильных архитектур не было, тесты собирали вручную, а пайплайн допиливали напильником. Сейчас архитектуры агентов переносят с одного бенчмарка BitGN на другой и выигрывают с ними в сторонних соревнованиях. Значит, собственная обвязка перестала быть местом, где вы получаете преимущество, — преимущество осталось в доменных инструментах и проверках.
⚡ Как применить
Взять ближайшую задачу «прикрутить LLM к сервису» и собрать её на готовом harness, оставив себе только доменные инструменты и валидацию.
Описать задачу набором инструментов со схемами вместо цепочки промптов: порядок вызовов и повторы harness разрулит сам.
Сравнить с прошлым похожим пайплайном по двум числам: дни до рабочего прототипа и строки собственной обвязки.
Риск чужой harness тащит свои допущения про размер контекста и цену вызова. На узкой доменной задаче с жёстким SLA он выходит дороже короткой самописной цепочки.
AI резко удешевил анализ чужого кода, поиск уязвимостей и сборку эксплойтов: разобрать бинарь или железку теперь можно связкой Ghidra/IDA, Wireshark и Qwen/DeepSeek, не будучи специалистом. Вывод автора: код стареет не тогда, когда перестаёт работать, а когда его дёшево сломать.
Почему важно: раньше сервис можно было запустить и держать годами с апдейтами раз в год. Эта стратегия держалась на том, что разбор вашего кода стоил чужого времени. Сейчас не стоит, поэтому проверка и обновление переезжают из разряда «когда-нибудь» в регулярную работу без отрыва от продакшена.
⚡ Как применить
Выбрать один сервис, который приносит деньги и давно не обновлялся, и дать агенту задачу: перечислить устаревшие зависимости и места, где пользовательский ввод доходит до опасных вызовов.
Поставить в CI еженедельный govulncheck плюс короткий агентский разбор диффа go.mod.
Отметить, сколько находок первого отчёта подтвердились руками, и повторить прогон через месяц: доля подтверждённых покажет, держать это в CI или выкинуть.
Риск на легаси агент выдаёт много ложных срабатываний. Без ручной фильтрации первых отчётов задача превращается в шум, который команда перестаёт читать.
Автор вернулся из поездки, где на рейсах раздавали интернет от Starlink, и всю дорогу вёл разработку через связку Codex-агентов: Remote на сервере плюс оставленный открытым ноутбук. Идеи, BDD-спеки и каркас платформы он собирал практически на ходу с сотового.
Почему важно: главное наблюдение тут не про Starlink. Когда ноутбука под рукой нет, отговорка «мне самому проще и быстрее руками» просто не срабатывает. Через несколько дней такой работы выясняется, что агентом и правда быстрее, а инструменты вокруг него нарастают сами собой.
фото из поста · t.me/llm_under_hood/924
Кадр из поста. На экране кресла — данные рейса, ниже ноутбук с терминалом агента и спекой. Ровно та ситуация, из которой автор делает вывод про интеграцию агентов в жизнь.
⚡ Как применить
Поднять remote-агента с доступом к репозиторию и проверить его на одной задаче из дороги, сознательно не открывая ноутбук.
Формулировать задачу как BDD-спеку («дано / когда / тогда»), а не как список правок: с телефона это короче, и агент меньше домысливает.
За неделю посчитать, сколько задач ушло агенту в момент, когда раньше вы отложили бы их «до ноутбука».
Риск ревью с телефона поверхностное, легко принять работу, где агент собрал не то. И удалённой сессии нужен доступ к репозиторию с сервера — отдельный разговор про секреты и права.
Автор считает эру чтения обычного кода законченной и вместо этого дотошно расспрашивает модель о реализации: потоки данных и условия. В расспросах регулярно всплывает дичь, которую он тут же чинит, снова не открывая файлы. Отдельная привычка — читать скиллы глазами: модели плохо абстрагируются и слабы в мета-промптинге, поэтому сгенерированные ими скиллы приходится дорабатывать.
Почему важно: вопросы масштабируются лучше построчного чтения диффа на несколько сотен строк. А скилл — это код, который пишет код: ошибка в нём тиражируется на каждый следующий запуск, поэтому чтение окупается именно там.
⚡ Как применить
После выполненной задачи задать агенту три вопроса: откуда и куда текут данные, при каких условиях срабатывает каждая ветка, что произойдёт на пустом и битом входе.
Открыть глазами только те файлы, по которым ответ вышел мутным или противоречивым.
Каждый сгенерированный скилл и AGENTS.md вычитать самому, но не править руками: показать агенту проблемное место и попросить переписать.
На одном PR разложить найденные проблемы в два списка: что нашли вопросы и что нашло обычное чтение диффа.
Риск модель уверенно описывает код, которого нет. Вопросы ловят кривую логику, но не ловят пропущенную проверку, поэтому на security-чувствительных местах чтение всё-таки нужно.
OpenAI снизила цену на GPT 5.6 Sol. Для контекстов меньше 272k токенов — $4/$20 за миллион, для длинных — $8/$30. Инпут подешевел на 20%, аутпут — на треть. Акция рассчитана на три месяца и действует как для API, так и для кредитов Codex и ChatGPT Work.
Почему важно: стоит перевалить за 272k токенов, и входные токены дорожают вдвое, а выходные — с $20 до $30 за миллион. Привычка «закинуть в контекст весь репозиторий на всякий случай» становится платной, а на длинных агентских сессиях контекст растёт сам, так что разница набегает за рабочий день, а не за квартал.
⚡ Как применить
Снять с типовой агентской сессии реальный расход токенов и посмотреть, как часто она переваливает за 272k.
Выкинуть из стартового контекста то, что агент достанет инструментом: дерево файлов, схемы таблиц, длинные логи.
Сравнить недельный счёт до и после. Если он не сдвинулся, контекст был ни при чём и экономить надо в другом месте.
Риск скидка действует три месяца. Экономику фичи, которая живёт дольше, считайте по старой цене.
Кастомный скилл поднял Claude Opus 5 на ARC AGI 3 с 30% до 100%, потратив примерно вдвое меньше шагов. Правил датасета внутри нет: в тул-колл зашит жёсткий логический блок. Если модель не рассуждает перед ответом и не заполняет ячейки с предсказанием следующего шага, предсказание отправляется на доработку.
Почему важно: механика переносится на любой инструмент со строгим форматом вывода — заполнение таблиц, генерация конфигов, структурированные ответы. Валидация внутри тула даёт повторяемость, которой не даёт просьба в системном промпте: агент видит ошибку и чинит себя сам, без вашего участия в цикле.
⚡ Как применить
Взять свой MCP-инструмент, где важен формат, и добавить в схему обязательные поля с рассуждением и ожидаемым следующим шагом.
Возвращать из тула ошибку валидации вместо того, чтобы принимать неполный ответ и чинить его постобработкой.
Прогнать двадцать одинаковых запросов до и после, сравнить долю ответов, прошедших схему с первой попытки.
Риск обязательные поля удлиняют каждый ответ и добавляют токенов. На простых вызовах гейт только замедляет, так что включать его стоит там, где формат уже ломался.
Автор канала перестал понимать, что пишет Opus 5: читает предложение и не может вытащить смысл. В X он нашёл ровно те же жалобы от американцев. Anthropic добавила output style concise, который должен эту проблему хотя бы уменьшить.
Почему важно: ответ, который начинается с результата и разворачивается в детали только по запросу, экономит и время чтения, и токены на длинной сессии. Автор предупреждает про важную деталь: /config меняет правила для конкретного проекта, а не глобально, и под анонсом это называют временной мерой до полноценного решения.
скриншот из поста · t.me/airanez/253
Скриншот из поста. Тут же лежит второй способ включения: "outputStyle": "Concise" в settings.json, если переключать вручную на каждом проекте не хочется.
⚡ Как применить
Включить Concise в /config → Output style на одном рабочем проекте и прожить на нём неделю.
Чтобы не переключать вручную в каждом репозитории, прописать "outputStyle": "Concise" в settings.json.
На одной и той же задаче сравнить, сколько раз пришлось переспрашивать агента, чтобы понять, что он сделал.
Риск настройка проектная, на соседнем репозитории её включать заново. И сжатие режет часть контекста: при разборе инцидента подробный ответ бывает нужнее короткого.
Автор выложил каркас своей лаборатории, которой управляет бот: общий сервер, роутер, postgresql, леджер с авторизацией, деплоилка и машинерия для виртуалок. Под каждый диалог поднимается microvm с движком бота; у неё своя постоянная память, не пересекающаяся с общей, плюс отдельный общий слой памяти с ролевым доступом.
Почему важно: два слоя памяти закрывают сразу две болячки самодельных агентов. Контекст одного пользователя не всплывает у другого, и при этом агент не начинает каждую сессию с чистого листа. Изоляция на диалог даёт то же самое для инструментов: сломанный запуск не утаскивает за собой соседние.
схема дайджеста по описанию из поста — не картинка источника
⚡ Как применить
Разнести состояние своего агента на два хранилища: приватное на сессию и общее с проверкой прав на чтение и запись.
Запускать инструменты агента в одноразовом контейнере на задачу, а не в общем долгоживущем процессе.
Поднять две параллельные сессии с разными правами и убедиться, что данные первой не попадают в ответы второй.
Риск microvm на каждый диалог — заметные накладные расходы на холодный старт. На редком трафике хватит контейнера с коротким TTL, а вот разделение памяти стоит сделать в любом случае.
Автор пишет, что работает практически на ванильном Codex и успевает много, тогда как вокруг люди выжигают месячные лимиты за день и при этом почти ничего не релизят. Вывод у него резкий: выкинуть спеки, консилиумы и прочую обвязку, оставить yolo-режим и полстранички правил — хотя бы про то, где расположен сервер, чтобы агент случайно не снёс нужное.
Почему важно: обвязка вокруг агента стоит времени на поддержку и токенов на каждый запуск, а её пользу почти никто не измеряет. Одна задача без неё — самый дешёвый способ выяснить, какие из ваших ритуалов работают, а какие вы носите по инерции.
⚡ Как применить
Взять одну задачу и сделать её ванильным агентом: без шаблона спеки, без субагентов, без ревью-консилиума.
Оставить единственный короткий файл правил с границами: где прод, какие каталоги трогать нельзя, что нельзя удалять.
Сравнить с похожей задачей прошлой недели по времени до мержа и по потраченным токенам.
Риск на размытых требованиях без спеки агент уходит не туда чаще. И на чужом легаси голый режим опаснее: полстранички правил может не хватить, чтобы очертить границы.
В сервере три WSE 3 Turbo, частоту подняли с 1,4 до 2,8 ГГц, и это вдвое увеличило пропускную способность памяти и FLOP/s. Памяти на чип те же 44 гигабайта, так что под обещанные 10T-модели нужно несколько десятков CS-4. Если такая скорость доедет до облаков, цикл «подумал → вызвал тул → подумал» перестанет упираться в ожидание.
Шесть миллиардов долларов за лицензирование технологий и офферы 109 разработчикам моделей, которые, скорее всего, займутся Nemotron. Сама Poolside получает миллиард инвестиций и, судя по планам на гигаваттный датацентр, переквалифицируется в неоклауд. Ещё одна независимая неолаба, известная по серии моделей Laguna, перестаёт быть независимой.
Терабайт SSD за полгода: промежуточные артефакты прогонов с 2D/3D и локальные модели. Явный мусор автор давно чистит, но остальное копится само. Вместо внешнего SSD он заказал корпус с Thunderbolt 5 и WD SN850X на 4 ТБ. Повод хотя бы раз посмотреть, сколько весят рабочие каталоги ваших агентов.
Один из создателей Kotlin делает инструментарий для агентской разработки. Про него говорили на стриме 20 августа вместе с Валерой Ковальским и Максимом Ключниковым — тема была про то, как писать код с агентами командой и не положить продакшн. Публичных деталей пока мало.
Из 22 прочитанных сообщений в дайджест попали 12. Восемь дали девять выводов — один пост вытянул сразу два, — ещё четыре ушли на радар. Оставшиеся десять фильтр не прошли.
Шутки и посты без содержания 2Реклама, ивенты, анонсы 3Повторы той же новости 1Железо и research без действия 1Нерелевантное (генерация картинок и видео) 3
🎯
План на неделю
Из девяти выводов — три, которые реально дойдут до дела. Не «прочитать», а сделать и померить.
Сделать: включить Concise в /config на рабочем проекте и прожить на нём неделю, считая, сколько раз пришлось переспрашивать агента.
до среды
Сделать: прогнать одну задачу ванильным агентом без спеки и субагентов, сравнить время до мержа с похожей задачей прошлой недели.
до пятницы
Сделать: добавить в один свой tool обязательные поля с рассуждением и следующим шагом плюс ошибку валидации, прогнать 20 запросов и посчитать долю ответов, прошедших схему сразу.
до воскресенья
#
Метаданные
сгенерировано 2026-08-24T16:38:02Z
окно 2026-08-17 — 2026-08-24 (7 дней), фолбэк не срабатывал
прочитано / в дайджест 22 сообщения / 9 выводов и 4 пункта на радаре
источник локальный кеш tdl-экспортов обрывался на 10 августа, поэтому 24 августа его обновили read-only командой tdl chat export
каналы с данными в окне эйай ньюз (9), Глеб Кудрявцев про AI (8), Остриков пилит агентов (2), LLM под капотом (2), AI RANEZ (1)
каналы без данных в окне AI и грабли, Tuzov AI Lab, { между скобок } анонсы, llm_x_news_in_actions
ссылки 22 из 22 постов с точными t.me-ссылками, best-effort нет
медиа два изображения восстановлены по ступени direct из публичных t.me-постов, см. media.json; схема к выводу 08 нарисована в дайджесте