Як зменшити витрати на сесії в Claude

Робота з великими мовними моделями вимагає не лише вмілого промптингу, а й розуміння витрат на їх використання. Денис Клименко, AI Architect та Software Engineer, поділився досвідом оптимізації витрат при роботі з моделлю Claude.

Причини високих витрат

Основна причина значних рахунків — специфіка обробки даних. Claude не має внутрішньої пам’яті, тому кожен новий запит включає в себе весь попередній діалог. Це призводить до зростання контексту та витрат:

  • «Найдорожче в роботі з Claude — це не самі відповіді, а „хвіст“, який ви тягнете за собою. 98% токенів — це перечитування вже сказаного», — зазначає Клименко.

Цифри та статистика витрат

На основі аналізу 30 сесій, інженер виділив кілька важливих спостережень:

  • Вартість запиту моделі Opus у довгій сесії становить $0.121, а в короткій — $0.078, що на 36% дешевше;
  • Сесії з контекстом понад 300 000 токенів формують 58% рахунку за перечитування кешу;
  • Найбільше ресурсів витрачається на виводи команд у терміналі (36–42%) та зчитані файли проєкту (28%).

Сесія починається з 40 000 токенів, а піки можуть сягати 405 000. Важливо, що скинути кеш не можна, лише закривши сесію.

Поради для оптимізації витрат

  • Відкривайте нове вікно для нових тем, щоб уникнути зайвого контексту;
  • Використовуйте команди /clear після завершення задачі та /compact лише під час тривалих розмов;
  • Не надсилайте великі логи, якщо питання стосується конкретної функції.

Клименко підсумовує, що оптимальна сесія повинна мати обсяг контексту не більше 200 000 токенів.


Джерело: dev.ua (https://dev.ua/news/iak-ne-pereplachuvaty-za-dovhotryvali-sesii-v-claude-1788783394)