GPT-6 Sol проти Claude Opus 5.5: чому в frontier‑AI рахуємо вже не токени, а задачі
OpenAI і Anthropic вийшли на новий раунд конкуренції: цього разу не стільки за «розум», скільки за рахунок за його використання. Нові моделі GPT-6 Sol, Luna та Claude Opus 5.5 різко знижують ціни й змушують бізнес дивитися не на бенчмарки, а на вартість виконаної задачі.
Anthropic представила Claude Opus 5.5 з ціною $4 за мільйон вхідних токенів і $20 за мільйон вихідних. Компанія обіцяє близько 40% економії порівняно з попереднім Opus 5 завдяки меншій кількості токенів і дешевшому кешу. Це все ще флагман з сильними результатами в кодуванні та агентних сценаріях.
Приблизно через півтори години OpenAI відповіла GPT-6 Sol і Luna. Sol коштує $2/$10 за мільйон токенів (вхід/вихід) — удвічі дешевше за Opus 5.5. Luna опустила планку ще нижче: $0.10/$0.50, тобто близько 1% від вартості Astra за «сирий» токен. Фактично це спроба зробити великі агенти й масові робочі навантаження повсякденним інструментом, а не розкішшю.
Перші живі тести The Neuron показали типову дилему: моделі з кращим «міркуванням» часто дають якісніший результат, але повільніше. GPT-6 Sol у їхньому експерименті швидше дійшов до робочої версії гри Cat Doom, тоді як Opus 5.5 ще «думав». В інших завданнях, навпаки, автори віддавали перевагу Opus, але він вимагав більше часу та грошей.
Ключовий показник, який пропонують дивитися і OpenAI, і незалежні тестери, — це не ціна токена, а вартість успішної задачі: скільки коштує одне коректно виконане завдання з урахуванням витрачених токенів, часу, кількості перезапусків і ручних «порятунків» людиною. Наприклад, OpenAI наводить AutomationBench, де Sol досягає 33,2% при вартості $0.27 за задачу, а більш «економна» Luna може досягати подібної фактичної точності до GPT‑5.6 Sol приблизно за соту частину вартості.
На цьому тлі дедалі очевиднішою стає стратегія «не одружуватися з однією моделлю». The Neuron радить: дорогий «фронтир» (Sol, Opus) використовувати для планування, складних рішень і рев’ю, а об’ємну рутину — віддавати дешевшим моделям або сабагентам на кшталт Luna. Це вже не теорія: у реальних кейсах на кшталт побудови ігор, реконструкції історичних локацій у Blender чи складних браузерних агентів саме така багаторівнева зв’язка дає найкращий баланс ціни й швидкості.
Чому це важливо
Для українського ринку, де бюджети на AI часто обмежені, а задачі — дуже різні (від підтримки клієнтів до аналітики й автоматизації держпослуг), ця «цінова війна» відкриває кілька практичних можливостей.
- Плануйте стек з двох рівнів. Не змушуйте найдорожчу модель робити все. Нехай Sol/Opus формулює технічне завдання, архітектуру й критерії приймання, а реалізацію, генерацію варіантів текстів чи коду виконує дешевша модель, що працює паралельно.
- Міряйте «вартість задачі», а не токена. Якщо ви агентство, продуктовий стартап чи медіа, рахуйте: скільки реально коштує згенерувати готову статтю, фічу, рекламну кампанію або відповідь саппорту, з урахуванням доопрацювань людиною.
- Тестуйте на своїх сценаріях. Зовнішні бенчмарки корисні, але вирішальним буде те, як модель поводиться у вашому CRM, кодовій базі, юридичних документах чи багатомовному контенті. Зробіть невеликий пілот із 2–3 моделями й порівняйте час, якість і витрати.
- Готуйтеся до ери агентів. Коли AI‑агент може годинами «воювати» з авіакомпанією за компенсацію або самостійно проходити складні веб‑процеси, бізнесу доведеться переосмислити підтримку клієнтів, внутрішні процеси й навіть цінові моделі. Для українських сервісів це шанс одразу будувати системи з урахуванням агентів, а не наздоганяти.
На мій погляд, головний зсув зараз — від питання «яка модель розумніша» до «як організувати роботу так, щоб розумні моделі окупали себе». І тут виграють ті, хто навчиться комбінувати різні LLM за ролями, а не просто платити за найдорожчий логотип у списку.
Джерело: The Neuron (https://www.theneurondaily.com/p/gpt-6-sol-vs-claude-opus-5-5)