Unslop Day
Усі випускипʼятниця, 24 липня 2026

Вийшов Claude Opus 5

Anthropic випустила Claude Opus 5, флагманську модель нового покоління.

PDF

===================================================================== Тема 1 (Головна). Вийшов Claude Opus 5 =====================================================================

Anthropic випустила Claude Opus 5 24 липня 2026.

Джерело: anthropic.com/news/claude-opus-5

Факти з першоджерела:

  • Ціна лишилась така сама, як у Opus 4.8: 5 доларів за мільйон вхідних токенів і 25 доларів за мільйон вихідних.
  • Frontier-Bench версії 0.1: Opus 5 обходить усі інші моделі і більш ніж удвічі перевершує Opus 4.8, при цьому вартість задачі нижча.
  • ARC-AGI-3: 30.2 відсотка проти попереднього рекорду 7.8 відсотка у GPT-5.6.
  • Цифри від ARC Prize.
  • CursorBench 3.2: в межах піввідсотка від піку Fable 5, за половину ціни.
  • OSWorld 2.0: перевершує найкращий результат Fable 5 приблизно за третину ціни.
  • Zapier AutomationBench: показник проходження приблизно в півтора раза вищий за наступну модель.
  • Доступна в Claude Code одразу, з автоматичним відкатом на Opus 4.8 для запитів, помічених як кібербезпекові.
  • Заявлена агентність: модель сама писала pipeline компʼютерного зору, коли не можна було подивитись напряму, сама будувала тестові харнеси і ітерувала до успіху.

Чому це важливо:

Якщо модель ніде не зафіксована в конфізі, сесії стартують на дефолтній і переїжджають на Opus 5 самі. Ціна не змінилась, якість зросла.

Незалежні відгуки практиків:

  • Siqi Chen (blader): Opus 5 знаходив баги у величезних складних кодбазах, яких не знайшли ні Fable, ні GPT-5.6-sol. Він використовує звʼязку, де Opus 5 планує, ревʼюїть і дебажить, а GPT-5.6 пише код. Називає це token arbitrage.
  • Claire Vo: сказала дослівно, що ненавидить з ним працювати, і при цьому в сліпому тесті поставила його вище за всі інші моделі, включно з Fable і улюбленим GPT-5.6.
  • Aaron Levie з Box: величезний стрибок на їхньому внутрішньому агентному бенчмарку для роботи з документами.
  • Ethan Mollick, професор Wharton: на коротких задачах модель дорівнює або перевершує Fable, на довгих менш амбітна. Помітив мовні дивацтва, схожі на Fable.

===================================================================== Тема 2. Чому фабрики коду провалюються =====================================================================

Есей Why Software Factories Fail, or harness engineering is not enough.

369 балів і 261 коментар на Hacker News.

Джерело: github.com/humanlayer/advanced-context-engineering-for-coding-agents

Теза: повністю автономні фабрики коду, де агенти пишуть без ревʼю людини, провалюються, бо моделі не тримають якість кодової бази в часі.

Механізм провалу:

Моделі тренують на бенчмарках, які винагороджують тільки проходження тестів.

За руйнування підтримуваності штрафу немає. Тому модель вчиться писати код, який проходить тести і накопичує технічний борг: погана архітектура, лінива робота з типами, ловля всіх винятків підряд.

Друга причина - швидкість зворотного звʼязку. Тести відповідають за секунди, це мільйони ітерацій навчання. Наслідки архітектурного боргу проявляються через тижні й місяці. Автор формулює так: немає способу пропагувати інцидент назад до рішення, яке його спричинило.

Цифри з дослідження Faros AI за 2026 рік, після впровадження AI у командах:

  • коментарів у ревʼю стало на 25 відсотків більше
  • пул-реквестів, змержених без ревʼю взагалі, стало на 31.3 відсотка більше
  • інцидентів на продакшені стало більше на 242.7 відсотка

Що автор пропонує замість автономії:

Повернути людину в цикл і перебудувати роботу так, щоб ревʼю було дешевим.

Стадії: дизайн продукту, потім архітектура системи, потім дизайн програми з сигнатурами типів, і лише потім вертикальні зрізи реалізації.

Ключова теза: тридцять хвилин планування економлять години ревʼю.

Друга: будувати вертикальні зрізи наскрізь, від даних до браузера, бо такий зріз можна перевірити руками одразу. І третя: забагато поганих пул-реквестів.

Чому це важливо:

Це рівно та конструкція, де агент пише код у репозиторій. Висновок: показувати план до написання коду. Не вивалювати на ревʼю готові пʼятсот рядків.

===================================================================== Тема 3. Війна за відкриті моделі =====================================================================

Головний конфлікт тижня в індустрії.

Дженсен Хуанг, засновник NVIDIA, зробив свій найперший пост в X за життя: лист NVIDIA до Конгресу США на захист відкритих моделей. 21 мільйон переглядів.

Аргументи: відкриті моделі посилюють безпеку і кібербезпеку, прискорюють інновації та поширення технології, дають країнам технологічний суверенітет.

Лист підписали: NVIDIA, Microsoft, Replit, Palantir, Dell, CrowdStrike, Hugging Face, a16z, IBM, Linux Foundation, Meta, Mistral, Mozilla, Perplexity, Box, Y Combinator та інші.

Тим часом OpenAI і Anthropic разом лобіюють обмеження на відкриті моделі, зокрема китайські. Про це написав Axios, матеріал зібрав 288 балів на HN.

Стаття Politico на цю ж тему набрала 1030 балів, друга за популярністю історія за дві доби.

Контраргумент від Parker Conrad, засновника Rippling: якщо Anthropic має рацію і дистиляцію неможливо запобігти, то відрив у фронтирних можливостях недовговічний, і аргументи національної безпеки на користь протекціонізму розсипаються. Якщо Китай вирветься вперед, його просто здистилюють.

Amjad Masad, CEO Replit, підписав лист і додав, що відкрита екосистема - найкращий спосіб зберегти конкурентність США.

===================================================================== Тема 4. Інструменти й релізи =====================================================================

OpenCode, проєкт Y Combinator набору W21 - опенсорсна альтернатива Claude Code і Codex, працює з будь-якою моделлю. З початку року виросла до 4.6 мільйона тижневих активних користувачів, 13 мільйонів місячних, приблизно 40 мільйонів доларів річної виручки. Обробляє 7 трильйонів токенів на день, більше за весь OpenRouter. Корпоративні клієнти самі підганяють їх пройти закупівлю швидше.

ChatGPT Voice зʼявився в десктопному застосунку: голосом можна керувати кількома агентами одночасно в ChatGPT Work і Codex. Працює на GPT-Live, слухає, говорить і координує паралельно. Грег Брокман, президент OpenAI: голос дає відчути, наскільки неприродно друкувати.

Flux 3 від Black Forest Labs - 531 бал на HN. Окремо вийшов Flux 3 Mimic, відео-моделі, які керують роботами.

Claude Cookbook - офіційна збірка рецептів від Anthropic, 275 балів.

Історія OpenAI про так званого rogue-агента розсипається. Спершу Саймон Віллісон, один з найавторитетніших оглядачів AI, розібрав те, що назвав випадковою атакою OpenAI на Hugging Face - 562 бали. Сьогодні Guardian вийшов із заголовком, що до історії OpenAI про хакера-агента варто ставитись скептично - 246 балів.

Безпекова історія дня: камера відеоспостереження Hanwha віддавала адміністративний токен GitHub прямо на сторінці логіну. 407 балів.

Нагадування, чому креденшли не місце в коді.

===================================================================== Тема 5. Найпопулярніше за межами AI =====================================================================

Ніл Стівенсон, автор Лавини і Криптономікона, написав есей про те, що письмо від руки корисне для мозку. 1416 балів і 642 коментарі, найпопулярніша історія за дві доби, обійшла всі AI-новини.

Також у топі: важко стало фокусуватись, 629 балів. І ще одна: нічого не працює, всі в ейфорії, 289 балів. Тема тижня - втома від швидкості змін.