Поставьте "stream": true — и аудио поедет кусочками (Transfer-Encoding: chunked), как только будут готовы первые байты. Так задержка до первого звука минимальна — идеально для длинных текстов и живого воспроизведения. Для голосовых агентов и плавной интонации между фрагментами используйте WebSocket API.

Node.js

Python

При ошибке потоковый ответ может прийти вообще без аудио. Всегда проверяйте HTTP-статус (res.ok) перед тем, как сохранять тело в файл.
Эмоциональные теги [смеётся], [шёпотом] и другие [...] работают и в потоковом режиме — см. Эмоции и интонации.