Skip to content
speechinfraConsole

MODELS & PRICING

The right model.
For your audio.

Explore each deployment’s supported languages, settings and API examples. Prices are in USD per audio minute, read from the same catalog as Console. Models may have different rates; current prices are not a promise of one permanent rate.

OpenAIASR

Whisper Large V3 Turbo

Fast multilingual speech recognition tuned for strong accuracy and lower latency.

whisper-large-v3-turbo-1
$0.005 / min
OpenAIASR

Whisper Large V3

Multilingual speech recognition for accurate transcription, translation and timestamps.

whisper-large-v3-1
$0.005 / min
OpenAIASR

Whisper Large V3 Turbo

Fast multilingual speech recognition tuned for strong accuracy and lower latency.

whisper-large-v3-turbo-2
$0.005 / min
OpenAIASR

Whisper Large V3

Multilingual speech recognition for accurate transcription, translation and timestamps.

whisper-large-v3-2
$0.005 / min
OpenAIASR

Whisper Large V3

Multilingual speech recognition for accurate transcription, translation and timestamps.

whisper-large-v3-3
$0.005 / min
NVIDIAASR

Parakeet TDT 0.6B v3

Efficient multilingual ASR designed for high-throughput, low-latency transcription.

parakeet-tdt-0.6b-v3
$0.005 / min
OpenAIRealtime ASR

Whisper Realtime

Streaming multilingual speech recognition powered by the Whisper model family.

whisper-realtime
$0.005 / min
DeepgramASR

Nova-3 Batch

General-purpose speech recognition with language detection and detailed timestamps.

nova-3-batch
$0.005 / min
DeepgramRealtime ASR

Nova-3 Realtime

Realtime speech recognition with fast partials and production-ready final transcripts.

nova-3-realtime
$0.005 / min
AssemblyAIASR

Universal-3 Pro Batch

High-accuracy speech recognition for multilingual audio and long-form transcription.

universal-3-pro-batch
$0.005 / min
AssemblyAIRealtime ASR

Universal-3 Realtime Pro

Low-latency streaming ASR for live conversations and responsive voice applications.

universal-3-realtime-pro
$0.005 / min
MOSIASR

MOSS Transcribe 1.0

General speech transcription optimized for clear, structured text output.

moss-transcribe-1.0
$0.005 / min
MOSIASR

MOSS Transcribe Diarize Pro

Speech transcription with speaker-aware segments for conversations and meetings.

moss-transcribe-diarize-pro
$0.005 / min
AlibabaASR

Fun-ASR Flash

Fast multilingual speech recognition for short audio and interactive workloads.

fun-asr-flash-sg
$0.005 / min
Alibaba · QwenASR

Qwen Audio 3.0 ASR Flash

Multilingual audio understanding and fast speech-to-text transcription.

qwen-audio-3-asr-flash-sg
$0.005 / min
Alibaba · QwenRealtime ASR

Qwen Audio 3.0 ASR Flash Streaming

Realtime multilingual ASR with incremental transcripts for streaming audio.

qwen-audio-3-asr-streaming-sg
$0.005 / min
Alibaba · QwenSpeech alignment

Qwen3 Forced Alignment

Aligns an existing transcript to speech and returns precise word-level timestamps.

qwenasr-align
$0.005 / min
DeepFilterNetEnhancement

DeepFilterNet3

Neural speech enhancement that suppresses noise while preserving voice clarity.

deepfilternet3
$0.005 / min
SileroVAD

Silero VAD

Detects speech regions in audio for trimming, segmentation and preprocessing.

silero-vad
$0.005 / min