Latency важнее точности в интерактивных сценариях: ответ за 300 мс с 90% качества бьёт идеал за 6 секунд.

Кэширование системных промптов снижает счёт заметнее, чем смена модели: рутина повторяется, и платить за неё каждый раз странно.

Модель — соавтор, а не оракул: она ускоряет готовое решение и бесполезна там, где нет постановки задачи.