GPT-6 Sol проти Claude Opus 5.5: коли ШІ вже не відповідає, а будує
Команда The Neuron запустила другий раунд публічного поєдинку між GPT-6 Sol та Claude Opus 5.5. Якщо перший раунд був ближчим до класичних тестів на кшталт «хто краще пише код і тексти», то тепер моделі поставили в умови справжньої розробки продукту — з усіма хаосом і зміною вимог.
Ключова відмінність цього раунду: моделі не можуть просто пояснювати, «як це зробити». Вони мають реально створювати робочі проєкти, використовуючи доступні інструменти, налагоджувати помилки, оцінювати власний результат і доводити його до стану, коли це вже щось, чим можна користуватися.
Автори прямо кажуть: Claude Opus 5.5 виявився настільки сильним у попередніх тестах, що довелося радикально ускладнити завдання. Замість чергових таблиць з балами — живий стрім на YouTube, де видно, як моделі поводяться в довгих, складних сесіях, а не в коротких запитах.
Цього разу GPT-6 Sol і Claude Opus 5.5 кидають у серію «живих» бенчмарків, які більше схожі на роботу невеликої геймдев- або R&D-команди:
- Interactive Black Hole Lab — побудувати симулятор чорної діри з гравітаційним лінзуванням, траєкторіями фотонів, керуванням і поясненнями.
- The Last Observatory — використовуючи Blender, створити й стилістично оформити мініатюрну планету, обсерваторію, астронавта, чорну діру, освітлення та анімацію.
- AAA CAT DOOM — еволюція їхнього «Cat Doom» у бік рівня DOOM Eternal: складніша ігрова логіка, краща графіка, системи та загальна «відполірованість».
- The Dark Souls Benchmark — побудувати гру з високою складністю, продуманими механіками, рівнями, атмосферою і, що важливо, реальною іграбельністю.
Базова інструкція для кожної моделі звучить жорстко: не розповідати, як це зробити, а робити, використовуючи інструменти, перевіряючи свій результат і працюючи доти, доки модель сама не вирішить, що проєкт готовий.
Оцінюють GPT-6 Sol і Claude Opus 5.5 за кількома параметрами: чи завершили завдання, яка якість візуалу, наскільки адекватні рішення, рівень автономності, практична корисність і ще одна неформальна метрика — «чи зробило щось таке, що змусило нас закричати».
Чому це важливо
На мій погляд, це показовий зсув від «чат-ботів» до агентних систем, які поводяться як молодші розробники або дизайнери. І для українського ринку це не абстрактна історія з Кремнієвої долини, а дуже практичний сигнал.
- Тест реальних робочих сценаріїв. Такі бенчмарки ближчі до того, як ви будете використовувати GPT-6 чи Claude Opus 5.5 у бізнесі: довгі сесії, зміна вимог, потреба щось «дошліфувати», а не просто відповісти на одне питання.
- Орієнтир для команд і фаундерів. Якщо ви будуєте продукт на базі ШІ — від внутрішніх агентів до ігрових студій — варто дивитися не на окремі «IQ-бали» моделей, а на те, як вони тримаються в таких складних, багатокрокових задачах.
- Підготовка до довгоживучих агентів. Те, про що говорять OpenClaw і CoreWeave, — це інфраструктура під системи, які працюють годинами чи днями, взаємодіють з інструментами, мають пам’ять, автоматизації й сувору безпеку. Це той рівень, куди доведеться рухатися й українським компаніям, якщо вони хочуть лишатися конкурентними.
- Нова роль людини в процесі. У таких сценаріях людина стає радше продюсером і арт-директором, ніж «ручним виконавцем». Ваше завдання — правильно сформулювати ціль, обрати інструменти, задати обмеження й оцінити результат, а не писати кожен рядок коду.
Якщо ви працюєте в продуктовій розробці, геймдеві чи креативних індустріях, раджу придивитися саме до таких «живих» тестів моделей. Вони краще за будь-які PDF-звіти показують, чи готовий конкретний ШІ стати частиною вашої команди, а не просто ще одним розумним чат-вікном.
Джерело: The Neuron (https://www.theneurondaily.com/p/live-gpt-6-sol-vs-claude-opus-5-5-round-2)