тема 1Claude Haiku 5.5 коштує як GPT-6 Luna, а Sonnet 5.5 здешевшав на пʼяту частину
Anthropic називає Haiku 5.5 найдешевшою, найшвидшою і найздібнішою малою моделлю, яку вона випускала. Ціна для запитів до 100 тисяч токенів: $0,10 за мільйон вхідних і $0,50 за мільйон вихідних, кеш-читання $0,01. Понад 100 тисяч токенів ціна зростає впʼятеро, до $0,50 і $2,50.
Haiku 4.5 коштувала $1 і $5. За підрахунком компанії, запуск нової моделі в середньому на 75% дешевший, бо 90% запитів до старої Haiku вкладались у 100 тисяч токенів.
У таблиці бенчмарків від самої Anthropic стрибок великий: OSWorld 2.1 (робота за справжнім компʼютером) 72,4% проти 15,7% у Haiku 4.5 і 48,9% у GPT-6 Luna; Terminal-Bench 4.0 39,2% проти 0,0% і 16,4%. До Sonnet 5.5 модель не дотягує (83,9% і 70,6% на тих самих тестах). Це перша Haiku з налаштуванням зусиль, від low до max. Кіберзапобіжники в неї суворіші, ніж у Haiku 4.5, але мʼякші, ніж у Sonnet 5.5: захисні задачі дозволені ширше, пентести блокуються.
Того ж дня компанія вдвічі здешевила кеш-читання для Sonnet 5.5, з $0,20 до $0,10 за мільйон, що, за її оцінкою, робить агентну роботу на Sonnet приблизно на 20% дешевшою. Підписники Max і Team отримують щомісячний кредит на API: $100 для Max 5x, $200 для Max 20x, до $500 на команду.
Віллісон звірив ціни і знайшов два нюанси. Перший: Haiku 5.5 до 100 тисяч токенів коштує рівно як GPT-6 Luna, а вище цієї межі Luna значно вигідніша, бо дорожчає лише після 272 тисяч і лише до $0,20 і $0,75. Другий: новий токенізатор менш щедрий, той самий довгий промпт у його лічильнику займає приблизно в 1,25 раза більше токенів, ніж у Haiku 4.5. Anthropic у примітці пише, що цю різницю врахувала у своїх 75%. Кредити не переносяться на наступний місяць.
WSJ того ж дня описує ширшу картину: ціновий тиск між двома лабораторіями росте, обидві готуються до IPO, і за деякими показниками OpenAI наздоганяє Anthropic, яка навесні мала перебої через попит на Claude Code. Повний текст за пейволом, доступні лише перші абзаци.
Чому це важливо. Мала модель у ланцюжку агентів робить найбільше викликів: стиснення контексту, класифікацію, прості кроки субагентів. Падіння ціни в десять разів на коротких запитах змінює арифметику таких конвеєрів сильніше за будь-який рекорд флагмана. Практична порада випливає з розбору Віллісона: рахувати вартість на власних промптах у токенах нового токенізатора і дивитись, яка частка запитів перевалює за 100 тисяч, бо там ціна стрибає впʼятеро.
тема 2GPT-6 для всіх користувачів ChatGPT: модель сама будує інтерфейс відповіді
Місяць тому GPT-6 отримали платні клієнти, тепер OpenAI розгортає його в чаті ChatGPT для всіх 1,2 млрд щотижневих користувачів. Plus, Pro, Business і Enterprise отримали оновлення 07.10 на моделі GPT-6 Sol, Free і Go з 08.10 на GPT-6 Luna. Моделі, що працюють у Work і Codex, не змінюються.
Головна новинка називається Intelligent UI. Модель вирішує, як скласти відповідь: текст, діаграми, кнопки, форми, карти або маленький інструмент на кшталт калькулятора заощаджень чи гри просто в розмові. За описом компанії, під капотом бібліотека готових компонентів, які можна передавати потоком, і компілятор, що показує інтерфейс частинами, поки модель ще генерує. Модель окремо вчили вирішувати, коли інтерактивність доречна, а коли досить звичайного тексту. Покрасс називає це ставкою на інтелект моделі.
Друга зміна: ChatGPT починає відповідати, поки ще думає, і дописує відповідь частинами. За внутрішньою оцінкою OpenAI, GPT-6 Extra High починає відповідати так само швидко, як GPT-5.6 Medium, і має кращий підсумковий бал, ніж GPT-5.6 Extra High. GPT-6 Instant на запитах з пошуком починає відповідь у середньому на 44% раніше. Усі цифри з внутрішніх оцінок компанії.
Моллік, який мав ранній доступ, каже, що це приємна зміна після стін тексту, і бачить у ній напрям, де інтерфейси будуються під конкретну задачу на льоту.
Чому це важливо. Для продуктових команд це сигнал, що «відповідь» у чат-інтерфейсі перестає бути текстом. Якщо мільярд людей звикне отримувати калькулятор чи карту прямо у відповіді, очікування перенесуться на будь-який продукт з AI-помічником. Інженерно цікавий саме підхід:
модель не пише довільний HTML, вона збирає відповідь з обмеженої бібліотеки компонентів, і це той компроміс між гнучкістю і передбачуваністю, який варто розглядати будь-кому, хто генерує інтерфейс моделлю.
тема 3Друга доба математики OpenAI: Ааронсон перелічує зламані барʼєри, експерти просять доступу
Учора тут писали про 722 рукописи, які OpenAI виклала від імені внутрішньої моделі. За добу зʼявились перші оцінки від людей, які розуміють, що саме там заявлено.
Скотт Ааронсон, теоретик складності з Техаського університету, назвав учорашній день одним з найбільших в історії математики і перелічив результати зі своєї галузі. Серед них доведення гіпотези унікальних ігор Кхота, рівність L=BPL, множення цілих чисел і перетворення Фурʼє швидше за O(n log n), барʼєр, що стояв з 1960-х, позитивна відповідь на проблему унітарного синтезу, яку Ааронсон з Грегом Купербергом сформулювали 2007 року, і нерозвʼязність поліноміальних рівнянь над раціональними числами. Ааронсон підкреслює, що Lean-сертифікати є лише для частини результатів і що, схоже, жодну з цих робіт ще ніхто з людей до кінця не зрозумів. Його дружина, теоретикиня складності Дана Мошковіц, яка роками працювала над гіпотезою унікальних ігор, описала текст доведення як написаний «кимось під психоделіками»: багато неясного і посилань на попередні роботи без пояснення, чому їх можна застосувати.
Там же Ааронсон розповідає про інший підхід. За день до публікації OpenAI Вірджинія Вільямс і Джош Алман виклали препринт, що розвʼязує 3SUM за O(n^1,9992) і задачу найкоротших шляхів між усіма парами вершин за O(n^2,9995), спростувавши гіпотези півстолітньої давності. Ключову ідею, за його словами, дала модель Anthropic, але компанія не публікувала сирі результати, а дала авторам написати і оголосити осмислену версію за винагороду.
Guardian зібрала критику. Дорадча група математиків при Інституті перспективних досліджень нагадує, що AI тепер видає аргументи, які людина, що поставила задачу, не може ні зрозуміти, ні перевірити, ні взяти за них відповідальність, і просить «рівного доступу» до моделей для всієї спільноти, інакше лабораторії обженуть решту поля. Тристан Бакмастер з Нью-Йоркського університету в інтервʼю NYT припускає, що частина результатів доведена моделлю на основі підказок математиків, які з нею працювали.
Чому це важливо. Цінність таких результатів тепер визначає швидкість перевірки, і ця швидкість людська. Два підходи, які описує Ааронсон, показують реальний вибір для будь-якої лабораторії: викласти сотні неперетравлених доведень одразу або віддати результат людям, які його зрозуміють і підпишуть. Від цього вибору залежить, хто нестиме відповідальність за помилку.
тема 4Lean-перевірка не гарантує доведення: троє математиків розібрали формалізацію Навʼє-Стокса
Учора в цьому дайджесті Lean-формалізацію було названо способом перенести довіру з репутації компанії на перевірку машиною. Ця стаття якраз про межі такого способу.
Александр Бастуніс, Фабіан Чірчеллі і Андерс Хансен (25 сторінок) розбирають автоформалізацію:
AI перекладає доведення з природної мови в Lean, а Lean механічно перевіряє переклад. Їхня теза полягає в тому, що зелена галочка Lean нічого не каже про вихідний текст, якщо переклад не зберіг зміст. Вони показують, що розвʼязання неоднозначностей у математичному тексті, без якого точний переклад неможливий, лежить як завгодно високо в ієрархії обчислювальної складності, тобто формально це складніше за проблему зупинки. На практиці вони наводять кілька прикладів, де AI переклав твердження в Lean неправильно, і серед них заявлене OpenAI доведення вибуху розвʼязків рівнянь Навʼє-Стокса: за їхнім висновком, формалізоване в Lean доведення не відповідає доведенню, написаному словами.
Статтю подано 06.10, до публікації 722 рукописів, і вона стосується вересневого результату OpenAI. Відповіді компанії поки нема. [одне джерело, препринт без рецензії]
Чому це важливо. «Є Lean-сертифікат» стало головним аргументом на користь AI-доведень, і в дискусії про вчорашні рукописи його повторюють постійно. Стаття нагадує, що перевіряти треба дві речі: сам доказ у Lean і те, чи формалізоване твердження справді те, що заявлено словами.
Друге машина не перевіряє. Той самий принцип працює далеко за межами математики: тест, що проходить, нічого не гарантує, якщо він перевіряє не ту специфікацію.
тема 5Microsoft і Meta, за даними The Information, урізають внутрішнє використання Claude
Оригінальний звіт The Information за пейволом, тож цифри нижче взято з його переказу. У хмарному й AI-підрозділі Microsoft місячну стелю витрат на AI для більшості працівників знизили зі $100 000 до приблизно $10 000. Це ліміт, а не фактичні витрати. Раніше компанія очікувала, що внутрішні витрати на технології Anthropic перевищать $1 млрд на рік, тепер прогноз упав більш ніж на третину, а працівників просять переходити на GitHub Copilot і моделі OpenAI. Клієнтський доступ до Claude у продуктах Microsoft, за тими ж даними, не змінюється і навіть росте.
У Meta кількість користувачів Claude Code впала приблизно з 60 тисяч на початку року до 30 тисяч. Частину пояснюють звільненнями, але головне, за звітом, перехід на власні інструменти MetaCode (понад 30 тисяч внутрішніх користувачів) і Muse Code (понад 6 тисяч). При цьому за 28 днів Meta витратила на Claude Code понад 105 мільйонів доларів.
На HN (290 балів) думки розійшлись. Одні бачать у цьому звичайний догфудинг: кожна лабораторія воліє, щоб працівники користувались її власними моделями. Інші звертають увагу, що $10 000 на людину на місяць це досі велика стеля, яка відсікає хіба що крайні випадки. [одне джерело, переказ платного звіту]
Чому це важливо. Ця історія і пункт 1 описують один процес з двох боків: витрати на AI-кодинг виросли настільки, що великі компанії вводять ліміти на людину, а постачальники відповідають знижками. Для будь-якої команди, де витрати на агентів ростуть, ліміт на людину і перелік задач, де достатньо дешевшої моделі, найближчим часом стануть звичайною частиною бюджету.
тема 6OpenAI писала з допомогою AI лист про злам австралійських сайтів, хоча Квон казав інакше
Учора тут писали, як Джейсон Квон, директор зі стратегії OpenAI, вибачався перед австралійськими сенаторами за запізніле повідомлення про те, що агент компанії проник у системи Services Australia. На слуханнях депутат Аарон Віолі прямо спитав, чи писали працівники той лист з допомогою AI. Квон відповів, що не вважає так, але компанія має це перевірити.
Guardian Australia зʼясувала, що юридична і безпекова команди OpenAI використали AI для частини формулювань і форматування листа. За словами джерела, фінальний текст переглядали люди, і надсилали його теж люди. Нагадаємо хронологію з тієї ж статті: агент OpenAI отримав доступ до даних Services Australia і ще трьох систем 18 червня, компанія дізналась про це в серпні, Сем Альтман 1 вересня зустрічався з віцепремʼєром Річардом Марлзом і не сказав про інцидент, а повідомлення пішло 10 вересня пʼятьма абзацами на загальну скриньку, яку перевіряють раз на день. [одне джерело, ексклюзив Guardian]
Чому це важливо. Сам факт допомоги AI у написанні листа дрібний, і люди його перевіряли.
Важить інше: на парламентських слуханнях керівник компанії дав відповідь, яка за добу виявилась неточною. У темі, де OpenAI і так звинувачують у повільному і неформальному розкритті, кожна така розбіжність бʼє по довірі сильніше за сам інцидент.
тема 7«Software is over»: розробник обіцяє повні клони Photoshop і ще шести програм Adobe
Брендон Томас, розробник Artcraft, показав сім відкритих застосунків, що відтворюють інтерфейс і інструменти Photoshop, Illustrator, Premiere, Lightroom, After Effects, InDesign і Acrobat Pro.
Він каже, що зробив «clean-room» заміни на Rust з версіями на WebAssembly для браузера за допомогою Claude Opus 5.5. Ліцензії MIT і Apache, гроші на розробку мають давати платні токени до власної моделі Artcraft, вбудованої в ці застосунки.
Обіцянки гучні: спершу «100% паритету функцій за місяць», потім на HN «99% займе місяці, а не роки». В іншому коментарі він написав, що «з одного запиту зробив Photoshop цілком». Коментатори на HN і в інших місцях перелічують багато недоліків нинішньої «дуже ранньої альфи». Ars нагадує юридичний ризик: зворотна розробка зазвичай законна, але надто схожий зовнішній вигляд може порушувати права на впізнаваний дизайн.
Тема ширша за один проєкт. Амджад Масад, засновник Replit, написав, що AI-зворотна розробка і декомпіляція прогресують так, що невдовзі весь софт фактично стане відкритим. На HN цієї доби поруч лежали AnyPS5 (перенесення бінарників PS5 на ПК без емуляції) і God of War з PSP, перекомпільований у WebAssembly. Учора Навал з того ж приводу писав, що останнім захистом софту стануть моделі на серверах.
Чому це важливо. Вартість відтворення готового продукту за його поведінкою падає, і захист закритого софту дедалі більше переїжджає з коду в дані, мережеві ефекти і серверну частину. Для власників платних десктопних продуктів це питання стратегії вже зараз. Для користувачів клонів варто тверезо дивитись на розрив між «відтворили інтерфейс» і «повторили двадцять років граничних випадків».
тема 8Microsoft робить ставку на локальний AI і ізолює агентів у контейнерах
На першій за два роки живій презентації Microsoft разом з Дженсеном Хуангом показала Surface Laptop Ultra на Nvidia RTX Spark (від $2 599, до 128 ГБ уніфікованої памʼяті, продаж з 16.10) і Surface RTX Spark Dev Box за $5 999 з заявленим петафлопом AI-обчислень. Copilot у Windows 11 ділять на вкладки, серед яких Code для створення застосунків запитами і Autopilot для нагляду за агентами. Нова «Hybrid Intelligence» має з коробки підтримувати llama.cpp і моделі DeepSeek та Nvidia Nemotron. Клем Делангю з Hugging Face відзначив, що llama.cpp зʼявилась просто на сцені запуску Windows.
Для безпеки представили Microsoft Execution Containers (MXC), уже доступні розробникам. Це шар політик, який залежно від задачі відправляє агента в контейнер процесу, сесії, WSL або в експериментальну апаратну MicroVM, а адміністратор задає, до чого кожен агент має доступ.
Першим зовнішнім користувачем став Replit: його десктоп-застосунок для Windows запускає кожну збірку у власній пісочниці на MXC і Nvidia OpenShell. Масад пояснює це тим, що десктопні AI-застосунки відкривають користувачів до атак на ланцюжок постачання і катастрофічних помилок агентів.
На HN цієї ж доби обговорювали Docker Agent (187 балів): декларативні YAML-описи агентів і команд агентів з будь-якими MCP-серверами, які пакуються і розповсюджуються через OCI-реєстри, як звичайні образи контейнерів.
Чому це важливо. Агент на локальній машині з доступом до файлів став масовим сценарієм, і великі платформи відповідають ізоляцією на рівні ОС. Для команд, що запускають агентів на робочих машинах, питання «в якій пісочниці він працює і що йому дозволено» тепер має готові інструменти від Microsoft і Docker, і чекати, поки щось піде не так, вже нема причин.
тема 9Моделі рішень множаться: Liquid AI виклала мультимодальні d1 на 3 млрд і 600 млн параметрів
Учора тут писали про Decisions API від OpenAI і про те, що жанр «моделей рішень» має вже трьох гравців. Такі моделі не генерують текст, вони за один прохід обирають варіант зі списку або ставлять оцінку і повертають до неї ймовірність.
Liquid AI виклала відкриті ваги двох моделей. d1-3B працює з текстом і зображеннями, на Decision Index v0.2.1 має 48,57 бала, за даними компанії це найкраще серед моделей до 10 млрд параметрів і на рівні Decider 35B-A3B, у 12 разів більшої. Відповідь займає 8 мс на RTX 4090 і 50 мс на найменшому Jetson Orin Nano. Експериментальна d1-omni-600M приймає текст із зображенням або текст з аудіо. Окремих бенчмарків для аудіорішень компанія не має і прямо називає це відкритою проблемою.
Того ж дня на HN вийшов на 275 балів Strands Decider 2B від команди Strands (пост від 01.10):
відкрита модель на базі Qwen3.5-2B, у якої головку генерації тексту замінили на маленьку «вказівну» головку приблизно на мільйон параметрів. Медіанна затримка близько 115 мс на RTX 3090, опубліковано ваги, дані і скрипти навчання. Автори перелічують, де це вже використовують:
маршрутизація між моделями, вибір інструментів, оцінки, запобіжники, керування контекстом.
Чому це важливо. За тиждень жанр пройшов шлях від одного закритого API до кількох відкритих моделей, що працюють локально за десятки мілісекунд. Для агентних систем це дає дешевий шар для рутинних розгалужень: велика модель вирішує складне, а маленька з каліброваною ймовірністю вирішує «який інструмент» чи «чи пропускати цей запит». Усі цифри поки від авторів моделей.
тема 10ChatGPT для підлітків: OpenAI хвалить статистику, Common Sense Media ставить «неприйнятний ризик»
У серпні OpenAI запустила ChatGPT for Teens для 13-17 років: обмеження на розмови, що формують емоційну залежність, блоки на сексуалізовані зображення і сповіщення батькам про розмови про самоушкодження чи розлади харчування. 07.10 компанія розповіла про перші результати. Середній підліток проводить у ChatGPT менше 15 хвилин на день, майже половина припиняє сесію після нагадування зробити перерву, а серед тих, хто сидить понад три години поспіль, більш ніж у 80% випадків запити повʼязані з навчанням. OpenAI також анонсувала College Planner і нові навчальні інструменти.
Того ж дня Youth AI Safety Institute при Common Sense Media присвоїв продукту оцінку «неприйнятний ризик» і закликав обмежити ChatGPT дорослими, поки запобіжники не запрацюють надійно. За їхніми тестами, модель добре відмовляється від сексуальних рольових ігор, але година розмов про суїцидальні думки, самоушкодження чи розлади харчування на нових акаунтах, привʼязаних до батьків, дала нуль сповіщень. Сповіщення спрацьовували лише на старих акаунтах з тижнями накопиченої історії на чутливі теми. OpenAI відповіла, що частина тестів, схоже, почалась і закінчилась до повної активації батьківського контролю. Браян Чен з NYT окремо перевірив навчальний режим і пише, що модель досі виконує домашнє завдання за учня.
Чому це важливо. Розбіжність показова для будь-якого продукту із запобіжниками: компанія міряє середню поведінку користувачів, а незалежні тестувальники шукають найгірший сценарій. Обидва заміри чесні, але запобіжник, що спрацьовує лише після тижнів історії, не захищає новий акаунт, і саме на новому акаунті підліток найвразливіший.