Green Speech LM is an edge consecutive interpreter architecture across 140+ languages. Powered by Qwen3-ASR-0.6B (52 langs + Auto-LID), Gemma 4 E2B-it, and a dedicated ja↔en direct S2TT fast-path. Verified on Host GPU baselines and actively progressing through on-device physical ARM latency gates.
ADR 006 establishes a streamlined cascade combining Qwen3-ASR (52 languages + Auto-LID) with Gemma 4 E2B-it, alongside a dedicated ja↔en direct S2TT fast-path.
User taps Start. Qwen3-ASR (52 langs) transcribes and emits language tag directly, routed to Gemma 4 E2B-it for 140-language direct translation.
ja↔en pairs invoke voiceping-ai/qwen3-asr-ja-en direct S2TT (2.04B INT4), bypassing intermediate LM decode for ultra-fast ≤1.4s turnaround.
Target language is locked, while source language is automatically inferred by Qwen3-ASR. Long-tail languages outside 52 fall back to Omnilingual CTC.
Interactive simulation of the ADR 006 state machine routing logic (Automatic / Guided / Hybrid) across ASR specialists, direct S2TT, and Gemma 4.
Evidence-first verification on Host GPU (CUDA 12.4) and Android AVD emulator. Physical ARM device latency and quantization gates (G2/G3/G4-ARM) are explicitly distinguished as active pending gates.
| Test ID | Component | Runtime Environment | Lang / Pair | Primary Metric | Latency / Memory | Status & Gate |
|---|---|---|---|---|---|---|
G2-SHERPA-ONNX-06B-INT8 |
Qwen3-ASR-0.6B INT8 (csukuangfj2) | sherpa-onnx 1.13.8 (CPU 4T) | ja | Norm CER 12.78% (Raw 17.74%) Delta: +3.66% vs float16 (+40.2%) |
2.86 s (mean) / Load 3.17 s | [ONNX-INT8] VERIFIED LID 100% (25/25), 5.2x faster than Nemotron |
G0-QWEN3-06B-JA |
Qwen3-ASR-0.6B (Auto-LID) | Host PyTorch CUDA 12.4 | ja | Norm CER 9.12% (Raw 13.52%) | 1.30 s (mean) / 1.61 GB VRAM | [HOST-GPU] PASS (Gate G0) Device INT8/CoreML Pending |
G4-DIRECT-S2TT-JA-EN |
Qwen3 ja↔en S2TT 2.04B INT4 | Host PyTorch CUDA 12.4 | ja → en | Corpus BLEU 13.56 | 1.32 s (mean) / 3.95 GB VRAM | [HOST-GPU] PASS (Gate G4) Device ARM Budget ≤1.4s Target |
P0-FLEURS-JA |
Whisper turbo (Oracle) | Host CUDA 12.4 | ja | CER 7.38% (mean) | 3.22 s (mean) / 3.18 GB VRAM | [HOST-GPU] ORACLE |
P0-FLEURS-EN |
Whisper turbo (Oracle) | Host CUDA 12.4 | en | WER 23.28% (mean) | 2.78 s (mean) / 3.18 GB VRAM | [HOST-GPU] ORACLE |
P1-NEMOTRON-JA |
Nemotron 3.5 ASR 0.6B | Host ONNX INT4 CPU | ja | CER 17.49% (mean) | 15.00 s / Load 1.80 s | SUPERSEDED Poor CPU Latency & CER |
AVD-S2TT-GEMMA |
Gemma 4 E2B-it LiteRT-LM | AVD API 34 (x86_64 Emulator) | ja → en | Qualitative Smoke Only (No BLEU) | 15.45 s (x86 CPU) / Harness RSS 48 MB | [EMULATOR] INCOMPLETE Unverified on physical ARM NPU |
AVD-NEMOTRON-LOAD |
Nemotron ONNX INT4 | AVD API 34 (x86_64 Emulator) | ja | E007 Decode Crash (nemotron_speech) | Load 4.95 s / RSS 106 MB | FAILED (E007) Custom RNN-T prohibited |
To eliminate progress theater, we explicitly state that all primary CER and BLEU benchmarks were executed on Host GPU (CUDA 12.4). Physical on-device execution on ARM targets (iPhone Neural Engine via CoreML and Android Snapdragon/Tensor via sherpa-onnx INT8) represents active milestone gates (G2/G3/G4-ARM). Host numbers are not conflated with on-device measurements.
Embed Green Speech LM in your Android, iOS, or Python applications.
// Android Kotlin (SpeechSession.kt)
val session = SpeechSession(SessionConfig(mode = InterpretMode.AUTOMATIC))
session.startListening()
// On utterance end with LID
val backend = session.onUtteranceEnd(LidResult(language = "ja", confidence = 0.94))
// -> backend routes to AsrBackend.NEMOTRON
// Transcribe and S2TT via Gemma 4 E2B-it
val translation = GemmaLitertLm.translate(
modelFile = File("/data/local/tmp/speechlm/gemma-4-E2B-it.litertlm"),
prompt = "Translate to English. Source: $transcript",
cacheDir = File(context.cacheDir, "speechlm-litertlm")
)
session.onTranslationReady()
All models are used as published from official Hub repositories without unverified custom conversion.