NVIDIA відкрила SoL-Pi — система скорочує витрати токенів ШІ-агентів до 49%

NVIDIA виклала у відкритий доступ SoL-Pi — розширення для фреймворку Pi, покликане знизити витрати під час тривалої роботи ШІ-агентів. Вихідний код опубліковано на GitHub за ліцензією MIT.
SoL-Pi не є окремою мовною моделлю. Це надбудова над агентським середовищем Pi, яка намагається зменшити кількість повторних звернень до моделі, обсяг контексту, що передається повторно, і зайве читання великих результатів інструментів.
Проєкт з’явився внаслідок автоматичних дослідницьких циклів NVIDIA. ШІ-агенти запропонували 152 напрями оптимізації, після перевірки яких до фінальної системи увійшли чотири механізми.
Один об’єднує послідовні дії — як-от редагування файлу та його подальшу перевірку — в один виклик. Другий замінює повторну передачу великих результатів інструментів компактними посиланнями з можливістю точно відновити потрібний фрагмент. Третій стискає завершені частини контексту, а четвертий передає читання довгих логів дешевшому агенту, звіряючи цитовані ним рядки з оригіналом.
NVIDIA's SoL-Pi, now on Hugging Face paper pages
— DailyPapers (@HuggingPapers) September 18, 2026
A token-efficient agent harness built by recursively scaling auto-research loops. It cuts token traffic by 44.7-49.0% and API cost by about one third while preserving performance. pic.twitter.com/EMhnRRqkSW
До 49% менше токенів, але з невеликою втратою результату
Найпомітніший ефект NVIDIA отримала в EdgeBench — наборі з 51 тривалого агентського завдання, кожне з яких може вимагати кількох годин роботи.
У випробуванні з GPT-5.6 Sol звичайний Pi використав близько 2,154 млрд токенів, тоді як SoL-Pi — приблизно 1,099 млрд. Отже, витрати скоротилися приблизно на 49%.
Розрахункова вартість роботи моделі зменшилася з $1339 до $894, тобто приблизно на третину.
Водночас економія не була цілком безплатною з погляду якості. Середній результат SoL-Pi становив 42,0 бала проти 44,8 у звичайного Pi — близько 94% результату вихідного середовища.
На сторінці проєкту NVIDIA прямо зазначає цей компроміс: з GPT-5.6 Sol і Claude Opus 5 система зберігала приблизно 94% середньої оцінки Pi, водночас скорочуючи витрати токенів на 45–49%.
Тож формулювання про «ту саму якість за вдвічі меншої кількості токенів» було б надто сильним. Ідеться радше про значне зниження витрат за відносно невеликої втрати результату в конкретних тестах.
Оптимізації можна вмикати окремо
SoL-Pi встановлюється поверх звичайної версії Pi і не потребує зміни її вихідного коду. Усі чотири механізми типово вимкнені й активуються окремо через конфігурацію.
Це дає змогу, наприклад, використовувати лише локальні оптимізації, не підключаючи механізм, який може надсилати довгі діагностичні логи додатковій моделі.
NVIDIA також перевірила SoL-Pi з Claude Opus 5. У цьому разі витрати токенів щодо Pi скоротилися приблизно на 44,7%, а вартість — приблизно на третину.
Автори порівнювали систему й з нативними агентськими середовищами на кшталт Codex і Claude Code, де в окремих тестах економія виявилася ще вищою. Однак результати стосуються конкретних моделей, налаштувань і тривалих завдань EdgeBench, тому переносити ті самі відсотки на будь-який агентський сценарій не можна.
SoL-Pi цікавий насамперед як приклад того, що ефективність ШІ-агентів можна підвищувати не лише завдяки новим моделям. Значна частина витрат виникає через саму організацію роботи агента — повторну передачу контексту, довгі логи й додаткові кроки моделі, які іноді можна прибрати на рівні програмного середовища.