"stream": true — и аудио поедет кусочками
(Transfer-Encoding: chunked), как только будут готовы первые байты. Так
задержка до первого звука минимальна — идеально для длинных текстов и живого
воспроизведения.
Для голосовых агентов и плавной интонации между фрагментами используйте
WebSocket API.
Node.js
Python
Эмоциональные теги
[смеётся], [шёпотом] и другие [...] работают и в
потоковом режиме — см. Эмоции и интонации.