тема 1Anthropic виклала три метрики зсередини лабораторії: Claude «веде» 26% їхньої AI-розробки, 30 000 агентів одночасно, 6% компьюту на безпеку
[одне джерело - власна публікація лабораторії, стороннього підтвердження поки нема]
Місток до вчора. Вчора OpenAI перевела слова в процедуру і виклала шість випадків розлагодження. Сьогодні Anthropic зайшла з питання «з якою швидкістю вони взагалі їдуть». Ключова фраза в них та сама, що в OpenAI вчора - розрив між тим, що знає лабораторія, і тим, що знає публіка:
«Поки світ обмірковує, як задати темп фронтіру, лабораторія має зробити все можливе, щоб мінімізувати розрив між тим, що знають фронтір-лабораторії, і тим, що знає публіка».
Вперше названо числа. Три метрики:
(1) Скільки AI-розробки робить сам AI. Побудували Anthropic R&D Automation Index: за шкалою Epoch AI від AL0 (без AI) до AL5 (повна автономія).
Станом на серпень 2026:
- Claude не працює повністю автономно в жодному виміряному сегменті AI R&D;
- Claude «веде» (AL4 - робить більшість задачі з високорівневого промпта, людина наглядає) 26% роботи;
- частка роботи на рівні «AI співпрацює» і вище - понад 90%.
Застереження від них же варто прочитати уважніше за цифру. Вони оцінюють себе
власними моделями: «модель-суддя може робити ті самі помилки, що й модель, яку вона перевіряє». Для калібрування дали людям оцінити ті самі ділянки наосліп:
збіг моделі з людиною 59%, людини з людиною - 35%, у межах одного рівня - 97% випадків. Модель-суддя узгоджується з людьми краще, ніж люди між собою, що радше говорить про розмитість шкали.
(2) Нагляд за агентами. Станом на серпень у них ~30 000 агентів одночасно роблять дослідницьку й інженерну роботу на головній внутрішній платформі:
- 100% дій агентів проходять через онлайн-монітор до виконання;
- монітор позначає ~100 000 транскриптів на тиждень, з них ~50 на тиждень ескалюються до людини;
- проаналізували понад мільярд рішень агентів за серпень: заблоковано 0,002% (приблизно 1 з 47 000).
(3) Розподіл компьюту. Зріз за тиждень 13-20 липня: ~6% компьюту, що пішов на AI R&D, витрачено на безпеку; серед AI-driven AI R&D - ~12%. Оцінка свідомо консервативна: якщо токен однаково просував і можливості, і безпеку, його
не рахували як безпеку.
Що з цього можна повторити ззовні. Головна теза посту: «будь-який фронтір-розробник може публікувати те саме, і треті сторони можуть це перевіряти». Під кожною метрикою окремий розділ «що будь-який розробник міг би звітувати вже сьогодні».
Чому це важливо
Найцінніше тут методологія, і вона знімається один в один на будь-який схожий конвеєр.
Індекс автоматизації вони будували так: зібрали ~15 000 реальних задач з робочих слідів (Slack, внутрішня документація), звели в дерево на 542 вузли,
заморозили його і далі міряють кожен місяць проти того самого кошика.
Заморожений кошик - рівно те, чого бракує таким оцінкам: без нього «стало точніше» порівнюється з розмитим спогадом.
Друге: вони окремо перевірили чи не зʼявляються нові типи роботи, на які люди переїхали (побудували альтернативне дерево з січня і порівняли), і не знайшли зростання «нових» задач. Це протиотрута від самообману «все автоматизовано», коли насправді робота просто переїхала в іншу графу.
Третє, найпрактичніше - дизайн їхнього агентного середовища:
- Ідентичність. Кожен агент має власну незмінну ідентичність, і всі його дані привʼязані до неї. Сенс: агент відрізняє себе від інших і трактує те, що прийшло від іншого агента, як твердження, яке треба перевірити. Правило про індикатор і артефакт, вшите в архітектуру.
- Відкрита комунікація. Агенти спілкуються через спільну відкриту шину, і кожне повідомлення лінкує першоджерело, щоб не було «зіпсованого телефона». Плюс агенти бачать помилки одне одного і можуть їх виправляти.
Мітка [proven] на самих замірах (вони опубліковані з методологією), [fuzzy] на їх інтерпретації: це самозвіт, звірений власними моделями, і зовнішньої верифікації, про яку вони самі просять, поки не існує.
тема 2Epoch AI почала аудит бенчмарків: з перших 15 - девʼять «Flawed», чотири «Verified»
підтверджено: власний реліз Epoch + рознесено Мольіком
Epoch AI запустила Benchmark Reviews - регулярний аудит самих бенчмарків.
Перша партія - 15 бенчмарків: 4 Verified, 9 Flawed, 2 Not Enough Info.
Що означають вердикти (з їхньої методології):
- Flawed - є суттєві вади, які треба знати, щоб правильно читати результати; найтиповіша - «понад 20% задач містять помилки, що впливають на точність». По таких публікується обмежений опис знайдених вад.
- Verified - бенчмарк можна загалом інтерпретувати так, як заявлено, а наявні помилки суттєво не впливають на результат. Публікується повна рецензія, включно зі слабкими місцями й обмеженнями.
- Not Enough Info - доступу до даних забракло для висновку.
Окремо чесний хід: власні бенчмарки Epoch не рецензує через конфлікт інтересів і запрошує зробити це ззовні.
Місток до вчора. У вчорашньому misc був Мольік з тезою, що стан публічного бенчмаркінгу жалюгідний: найвідоміші метрики вичерпані, а ненасичені «настільки рясніють помилками, що суттєво недооцінюють здібності ШІ». Вчора це було гаслом без цифри. Сьогодні під нього лягла цифра: 9 з 15 - Flawed, і критерій названий (>20% задач з помилками).
Чому це важливо
Пряме і неприємне: більшість цифр, якими міряються моделі в новинах - і в цих же дайджестах - приходять з бенчмарків, девʼять з пʼятнадцяти яких не витримали першої зовнішньої перевірки. Наводити їх далі можна, але джерело цифри треба називати так само акуратно, як джерело новини.
Практичний висновок один: коли зʼявляється «модель X набрала Y на бенчмарку Z», варто сходити в цей каталог і подивитись, чи є в Z вердикт. Це дешево (одна сторінка) і та сама логіка, що правило двох джерел, застосована до
вимірювального інструмента.
тема 3Berkeley заміряла «harness tax»: та сама модель, той самий результат, але вдвічі дорожче
Мелісса Пан, Шуо Янг, Іон Стойка і Матей Захарія (UC Berkeley) прогнали 21 пару модель-харнес: сім моделей на трьох харнесах (Claude Code, Codex CLI, Pi)
по SWE-bench Lite і Terminal-Bench 2.0.
Три висновки, і другий з третім цікавіші за перший:
- Харнес майже не впливає на те, ЧИ задача вирішена, але сильно впливає на ціну. Розкид успішності між харнесами - в межах ±2% на SWE-bench Lite і ±5% на Terminal-Bench 2.0. А вартість того самого результату відрізняється до 5×. Конкретно: Claude Fable 5 вирішує 97,8% спроб у Claude Code, 96,7% у Codex і 96,7% у Pi - тобто різниця в межах похибки, - але Claude Code коштує $1,33 проти $0,67 у Pi, вдвічі. Усереднено по спільних моделях: Claude Code дорожчий за Pi в 2,0× і за Codex у 1,6× на SWE-bench Lite.
- Простий харнес конкурентний.
Pi- мінімальний опенсорсний харнес з чотирма інструментами (read,write,edit,bash) - виходить на Парето-фронт на обох бенчмарках. - Модель може працювати краще на чужому харнесі, ніж на своєму. Формулювання з роботи: «виходить, моделям Claude може не бути потрібен Claude Code».
Масштаб експерименту: 30 випадково вибраних задач × 3 повтори на кожну пару. Сотень задач тут нема, і автори цього не ховають. Мітка [promising], не [proven].
Чому це важливо
Це найпряміша до гаманця річ у випуску, і вона римується з пунктом 1 зверху:
платиш за харнес, а міряєш модель. Вчорашній пункт про 4B-модель за $1 200 був про те, що дешевше можна натренувати; цей - про те, що дешевше можна ганяти те саме, нічого не тренуючи.
Типовий випадок: важка модель ганяється через товстий харнес заради рішення, яке все одно перевіряється скриптом - автоматичні гейти, класифікація в категорію, фільтр «релевантне чи ні». Висновок роботи в тому, що дефолтний харнес - це не безкоштовний вибір, і якщо успішність тримається в межах ±2%, то різниця в 2× по ціні це чистий податок за звичку.
Тверезо: ±2% на 30 задачах і ±2% на тисячі - різні твердження. Але перевірити це на власному конвеєрі коштує один вечір.
тема 4Король Чарльз зібрав саміт з лабораторіями і сказав про «екзистенційну небезпеку». Хуанг там говорив інакше, ніж два дні тому
Чарльз скликав саміт у Dumfries House (Ершир). Учасники: міністр ШІ Британії Канішка Нараян, радник Папи, представники Nvidia, OpenAI, Anthropic.
Його слова:
«Ті, хто створив ці технології, тепер дедалі частіше попереджають, що ШІ ризикує розвинути темніші здатності - можливо, навіть відбирати життя».
Мета саміту - зрозуміти, чи можна виробити «спільний набір принципів».
Найцікавіше - зміна регістру в Хуанга, видно її тільки в парі з позавчорашнім. Два дні тому на Dreamforce (випуск 16.09, пункт 1) його репліка була «біжіть так швидко, як можете». Тут, у тій самій ролі:
безпека «першочергова», і компанії мають притримати продукт і «продовжувати інженерити», якщо він недостатньо безпечний.
Він же далі відстоює відкриті ваги - щоб «люди й країни не лишились позаду».
Невідомо, що з цього його справжня позиція; фіксується лише факт, що
за дві доби та сама людина в двох залах сказала протилежне за тоном.
Гассабіс там же дав обережнішу лінію: AGI «імовірно, лише за кілька коротких років», вплив - «у десять разів більший за промислову революцію», шанс, що щось піде не так, «точно ненульовий», але є «розумний середній шлях».
Чому це важливо
Практичного значення нуль. Але як репер тижня сюжет закрився: шість діб тому це була суперечка в блогах і на сцені конференції, сьогодні - саміт з міністром і представником Ватикану, а дві лабораторії за добу виклали внутрішні метрики (пункти 1 і вчорашній 1). Тема переїхала з індустрії в політику, і далі новини про неї будуть приходити звідти.
тема 5OpenAI зробила вертикаль для юристів: 54% проти 38,7% на бенчмарку правового ресерчу
підтверджено: блог OpenAI + друга за обговоренням сторі доби на HN
Astra for Law - GPT-6 Astra з окремим правовим пошуковим індексом і інструкціями під юридичний аналіз. Індекс покриває понад 230 млн URL американського прецедентного права, статутів і регламентів; через партнерство з Free Law Project туди заходить понад 99,9% опублікованого прецедентного права США.
Цифри з їхнього ж заміру (200 питань з приватного валідаційного набору Vals AI Legal Research Bench): на максимальному рівні міркування Astra for Law проходить перевірку коректності на 54,0% питань проти 38,7% у звичайного GPT-6 Astra з веб-пошуком. Це +40% відносного приросту. Плюс на питаннях по прецедентах - на 24% більше знайдених справ і до 54% більше релевантних уривків.
Доступ - через Trusted Access для обраних фірм, API «скоро». Плюс 26 партнерських і 47 спільнотних плагінів (Thomson Reuters, Harvey, Legora, Relativity, Clio).
Чий це замір: бенчмарк сторонній (Vals AI), але прогін і цифри - самої OpenAI, незалежного відтворення нема. І прямо в тему пункту 2 вище: чи є в цього бенчмарка зовнішній вердикт - невідомо, у списку перших 15 рецензій Epoch його нема.
Чому це важливо
Тут важливий патерн, і Мольік сформулював його того ж дня точніше:
«Варто й далі питати, чи лабораторії просто зʼїдять кожну цінну вертикаль, особливо оскільки їхні витрати на розробку продукту падають дедалі нижче» @emollick (27 тис. переглядів)
Levelsio два дні тому сказав те саме грубіше: не видно економічної причини, чому OpenAI чи Anthropic не додадуть галузеві харнеси прямо в свій продукт - «ChatGPT для бухгалтерів», «Claude Medical»
@levelsio (56 тис.).
І ось тут воно стикається з пунктом 3 дуже незручно. Astra for Law - це
харнес (індекс + інструкції + плагіни) поверх тієї самої моделі, і він дає
+15 процентних пунктів. А робота Berkeley каже, що харнес дає ±2% по успішності і лише міняє ціну. Обидва твердження можуть бути правдиві, бо міряють різне: Berkeley - загальні кодинг-задачі, OpenAI - вузьку предметну область з власним пошуковим індексом. Різниця, схоже, в тому, чи приносить харнес
дані, яких у моделі не було. Висновок звідси: обгортка навколо моделі коштує уваги рівно настільки, наскільки вона додає доступ. Самі по собі інструкції такої надбавки не дають.
тема 6Модель на 27B стиснули в 9 разів до 5,9 ГБ - лишилось 98,2% якості
підтверджено: блог PrismML + HN + рознесено Hugging Face
Ternary Bonsai 2 27B на базі Qwen3.8 27B: тернарні ваги {−1, 0, +1} з FP16 групним масштабуванням - 1,76 ефективних біт на вагу, увесь ваговий слід
5,9 ГБ. Контекст 262K токенів, текст + зображення, ліцензія Apache 2.0.
Агрегат 83,9 проти 85,4 у повнорозмірного Qwen3.8 27B - тобто 98,2% збереження при девʼятикратно меншому сліді. Де саме втрати (їхня ж таблиця):
- Математика 96,57 проти 97,06 - майже без втрат
- Instruction following 82,66 проти 81,25 - стиснута вища за оригінал
- Кодинг 81,58 проти 82,17
- Знання й міркування 83,95 проти 86,66 - найбільша просадка
- Vision 78,59 проти 81,64, агентність і тулколінг 77,57 проти 79,74
Чому це важливо
Головне практичне тут - 5,9 ГБ. Це модель 27B-класу, яка влазить у памʼять звичайного ноутбука, під Apache 2.0, з контекстом 262K.
Але дивитись треба на розподіл втрат, і він незручний саме для агентних сценаріїв: найбільше просіли знання-міркування (−2,7) і агентність з тулколінгом (−2,2). Найменше - математика й instruction following. Тож «98,2%» - чесна цифра, яка для такого профілю навантаження означає менше, ніж звучить.
Де це реально лягає - у дрібні детерміновані рішення, про які мова в пункті 3:
класифікація, гейти, фільтри. Там просадка на знаннях майже не важить, а локальний запуск без оплати токенів критичний.