Як зменшити витрати на сесії в Claude
Робота з великими мовними моделями вимагає не лише вмілого промптингу, а й розуміння витрат на їх використання. Денис Клименко, AI Architect та Software Engineer, поділився досвідом оптимізації витрат при роботі з моделлю Claude.
Причини високих витрат
Основна причина значних рахунків — специфіка обробки даних. Claude не має внутрішньої пам’яті, тому кожен новий запит включає в себе весь попередній діалог. Це призводить до зростання контексту та витрат:
- «Найдорожче в роботі з Claude — це не самі відповіді, а „хвіст“, який ви тягнете за собою. 98% токенів — це перечитування вже сказаного», — зазначає Клименко.
Цифри та статистика витрат
На основі аналізу 30 сесій, інженер виділив кілька важливих спостережень:
- Вартість запиту моделі Opus у довгій сесії становить $0.121, а в короткій — $0.078, що на 36% дешевше;
- Сесії з контекстом понад 300 000 токенів формують 58% рахунку за перечитування кешу;
- Найбільше ресурсів витрачається на виводи команд у терміналі (36–42%) та зчитані файли проєкту (28%).
Сесія починається з 40 000 токенів, а піки можуть сягати 405 000. Важливо, що скинути кеш не можна, лише закривши сесію.
Поради для оптимізації витрат
- Відкривайте нове вікно для нових тем, щоб уникнути зайвого контексту;
- Використовуйте команди /clear після завершення задачі та /compact лише під час тривалих розмов;
- Не надсилайте великі логи, якщо питання стосується конкретної функції.
Клименко підсумовує, що оптимальна сесія повинна мати обсяг контексту не більше 200 000 токенів.
Джерело: dev.ua (https://dev.ua/news/iak-ne-pereplachuvaty-za-dovhotryvali-sesii-v-claude-1788783394)