OpenAI відкрила повний доступ до сімейства GPT-5.6 - флагманського Sol, збалансованої Terra та найдешевшої Luna. Розкатка триває у ChatGPT, Codex та API одразу глобально і має зайняти до 24 годин після старту. Головна теза релізу - не рекордні бали на бенчмарках, а більше корисної роботи на кожен витрачений долар і токен.

Три durable capability tiers замість однієї моделі

Ключова архітектурна ідея цього релізу - розв'язати номер версії й рівень можливостей. Цифра 5.6 означає покоління, а Sol/Terra/Luna - це "durable" рівні спроможності, які тепер можуть оновлюватися й розвиватися кожен у своєму темпі, не чекаючи на синхронний реліз усієї лінійки. По суті, OpenAI перейшла на той самий принцип, який Anthropic використала з парою Fable/Mythos - розділити "покоління" й "клас моделі" як два незалежні виміри.

Доступ розподілили по тарифах нерівномірно. У звичайному ChatGPT Sol дістається користувачам Plus, Pro, Business та Enterprise через середні й високі рівні "зусилля" (effort), а Pro/Enterprise додатково отримують Sol Pro для найскладніших задач. У ChatGPT Work і Codex безкоштовні тарифи Free та Go вперше отримують не обрізану модель, а повноцінну Terra - і це, мабуть, найпомітніша зміна політики доступу за останній рік.

Ціни та кешування - тут з'явилась цікава деталь

Ціни в API за мільйон токенів: Sol - $5 вхід / $30 вихід, Terra - $2,5 / $15, Luna - $1 / $6. Для порівняння: Opus 4.8 коштує $5/$25, а Fable 5 - $10/$50.

Технічно цікавіше не сама ціна, а зміна механіки кешування промптів. З'явились явні точки зупинки кешу (cache breakpoints), мінімальний час життя запису в кеші тепер зафіксовано на рівні 30 хвилин, а сам запис у кеш почав коштувати дорожче за звичайний вхідний токен - у 1,25 раза від некешованої ставки. При цьому читання з кешу зберегло стандартну знижку 90%. На практиці це означає: якщо у вас короткоживучий агентний воркфлоу з частими, але нетривалими сесіями, вигода від кешування може виявитись меншою, ніж раніше - варто перерахувати економіку промптів, якщо ви активно використовуєте system-prompt caching.

Programmatic Tool Calling - головна технічна новинка

Це, на мій погляд, найцікавіша інженерна деталь релізу. У Responses API з'явилась можливість писати й виконувати легкі програми "в пам'яті" (in-memory), які самі координують виклики інструментів, фільтрують проміжні дані та вирішують наступний крок без повернення кожного проміжного результату назад у модель через окремий раунд-тріп.

Практично це означає менше токенів і менше "ходів" моделі на задачах, важких на інструменти. У Rogo (фінансові дослідницькі агенти) це дало 24% менше вихідних токенів і на 28% швидше виконання при тій самій якості. У PlayCo (побудова Unity-сцен через структуроване API) - 63,5% менше токенів і 50,1% менше ходів моделі порівняно з прямими викликами інструментів. Важлива деталь для тих, хто працює з Zero Data Retention: Programmatic Tool Calling сумісний із ZDR-режимом, тобто проміжні дані не покидають пам'ять виконання.

Multi-agent і режим ultra

ultra - новий найвищий рівень спроможності: за замовчуванням координує чотири паралельні агенти, які досліджують різні підходи до задачі одночасно, а потім система синтезує фінальний результат. У тестах на BrowseComp і SEC-Bench Pro OpenAI показувала і конфігурації з 16 агентами - крива "якість/час" при цьому зсувається вгору й ліворуч, тобто кращий результат за менший час, а не просто лінійне масштабування вартості.

У продуктах ultra доступний вибірково: у ChatGPT Work - тільки Pro й Enterprise, у Codex - з тарифу Plus і вище. У самому API розробники отримують той самий механізм через бета-версію multi-agent у Responses API - можна запустити паралельні підагенти й отримати синтезований результат в одному запиті.

Бенчмарки: де Sol дійсно лідирує, а де ні

Тепер цифри з офіційної таблиці OpenAI - і тут важливо дивитись уважно, бо картина неоднорідна.

Агентне кодування. На Artificial Analysis Coding Agent Index v1.1 Sol набрав 80 балів проти 77,2 у Fable 5 і 72,5 у Opus 4.8 - і зробив це, за словами OpenAI, менш ніж за половину вихідних токенів і приблизно на третину дешевше.

Artificial Analysis Coding Agent Index - офіційний графік OpenAI з порівнянням GPT-5.6, Fable 5 та Opus 4.8

Реальна інженерна робота. А ось тут картина протилежна: на SWE-Bench Pro Sol набрав 64,6% - менше, ніж Fable 5 (80%) і особливо Mythos 5 (80,3%). Навіть найдешевша Luna (62,7%) відстає від обох моделей Anthropic на цьому тесті майже на 17-18 пунктів.

Зведена таблиця бенчмарків GPT-5.6 - офіційні дані OpenAI по SWE-Bench Pro та іншим тестам

Довгі професійні воркфлоу. На Agents' Last Exam - тесті довгих робочих процесів у 55 галузях - Sol виходить у лідери з 52,7% проти 40,5% у Fable 5 і 45,2% у Opus 4.8. У версії з максимальним reasoning-рівнем OpenAI заявляє ще більший розрив - 53,6 проти 40,5 (різниця 13,1 бала за їхньою методологією підрахунку).

Agents' Last Exam - офіційний графік OpenAI з результатами GPT-5.6 Sol

Математика. На FrontierMath Tier 4 (найскладніший рівень) Fable 5 випереджає Sol: 87,8% проти 83%. А от на Tier 1-3 ситуація зворотна: Sol - 89%, дані по Fable для цього рівня OpenAI не публікує.

Кібербезпека. Тут Sol показує найбільший прогрес відносно попередника: ExploitBench - 73,5% проти 47,9% у GPT-5.5, ExploitGym - майже подвоєння пікового результату (з 15,1% до 24,9% за дві години, до 33,7% за шість годин), SEC-Bench Pro - 71,2% проти 45,8%. Але порівняно з Claude Mythos 5 на ExploitBench Sol все одно відстає: 73,5% проти 78%.

Кібербезпека: reasoning-монітор і паспорт для доступу

Це другий поспіль реліз (після Fable 5 і Mythos 5 від Anthropic), який пройшов попереднє узгодження з урядом США - спершу доступ мали лише перевірені партнери, і повне відкриття узгодили лише напередодні загального релізу.

Технічно система захисту побудована в кілька шарів: тренована в модель безпека, поверх неї - real-time перевірки, моніторинг і контроль на рівні акаунта. Окремо цікаво, що OpenAI додала "reasoning monitor" - окремий шар, який аналізує весь контекст розмови на потенціал шкоди, а не покладається лише на класифікатори-фільтри (за їхніми словами, класична слабкість індустрії - рішення "блокувати чи ні" ухвалює менш розумна модель-класифікатор, яку важко швидко оновлювати).

Найчутливіші кібер-можливості доступні тільки через Trusted Access for Cyber - верифікацію особи. З 1 вересня для збереження доступу до найпотужніших кібер-моделей знадобиться апаратний passkey (Advanced Account Security); хто не встигне налаштувати - автоматично отримає урізаний доступ за замовчуванням. Перед релізом систему прогнали через приблизно 700 000 годин автоматизованого red-teaming на GPU A100e.

Що кажуть перші партнери

Президент Cursor Оскар Шульц назвав GPT-5.6 однією з найсильніших моделей, які вони тестували на CursorBench. CEO Qodo Ітамар Фрідман відзначив приблизно втричі менше токенів на PR-рев'ю при кращому F1 порівняно з GPT-5.5. А співзасновник Notion Саймон Ласт описав Terra як модель, що б'є вище своєї ціни - за його словами, чимало агентів на GPT-5.5 показують той самий результат на Terra за половину вартості й на 16% менше токенів.

Підсумок

GPT-5.6 не претендує на беззаперечне лідерство в усіх задачах: на реальній інженерній роботі (SWE-Bench Pro) і на найскладнішій математиці Fable 5 і Mythos 5 залишаються сильнішими. Але сама архітектура релізу - три незалежні capability-рівні, Programmatic Tool Calling для дешевших агентних воркфлоу, явний контроль над кешем і паралельні агенти в multi-agent beta - виглядає як спроба конкурувати не показниками на бенчмарках, а вартістю інженерної роботи на масштабі. І безкоштовна Terra в ChatGPT Work і Codex - можливо, найпрактичніший наслідок цього релізу для більшості розробників.