[ADR 006 Provisionally Accepted] Host Baselines Passed | On-Device ARM Gates Active

On-Device Consecutive Interpreter Engine

Green Speech LM is an edge consecutive interpreter architecture across 140+ languages. Powered by Qwen3-ASR-0.6B (52 langs + Auto-LID), Gemma 4 E2B-it, and a dedicated ja↔en direct S2TT fast-path. Verified on Host GPU baselines and actively progressing through on-device physical ARM latency gates.

9.12%
G0 CER (Host PyTorch)
Host CUDA 12.4: 9.12% | ONNX INT8: 12.78% (+3.66% delta, 2.86s CPU, 100% LID). Physical ARM pending.
100%
LID Accuracy (Host PyTorch)
Host CUDA 12.4: 25/25 correct language detection across 52 Qwen3 supported languages
1.32 s
G4 ja↔en (Host CUDA)
Direct S2TT 2.04B INT4 Host CUDA verified (BLEU 13.56). On-device ARM target: ≤1.4s.
140+
Target Languages
Cascade architecture supporting 140+ languages without intermediate English hub
Architecture & Routing

One Engine, Three Operating Presets

ADR 006 establishes a streamlined cascade combining Qwen3-ASR (52 languages + Auto-LID) with Gemma 4 E2B-it, alongside a dedicated ja↔en direct S2TT fast-path.

State Machine Execution Flow

01 / IDLE
Listening
VAD boundary capture
02 / ASR & LID
Qwen3-ASR
52 Langs + Auto-LID
03 / ROUTER
Hot-Path Route
Direct S2TT vs Gemma 4
04 / TRANSLATE
S2TT Decode
Direct S2TT / Gemma 4
05 / DISPLAY
Display
Instant text (≤1.9s)

1. Automatic (Default)

User taps Start. Qwen3-ASR (52 langs) transcribes and emits language tag directly, routed to Gemma 4 E2B-it for 140-language direct translation.

2. Guided (ja↔en Fast-Path)

ja↔en pairs invoke voiceping-ai/qwen3-asr-ja-en direct S2TT (2.04B INT4), bypassing intermediate LM decode for ultra-fast ≤1.4s turnaround.

3. Hybrid

Target language is locked, while source language is automatically inferred by Qwen3-ASR. Long-tail languages outside 52 fall back to Omnilingual CTC.

Interactive Demo

Engine Session Simulator

Interactive simulation of the ADR 006 state machine routing logic (Automatic / Guided / Hybrid) across ASR specialists, direct S2TT, and Gemma 4.

Status: IDLE
ROUTED ASR TRANSCRIPT QWEN3-ASR (0.6B INT8)
(Press Execute to simulate ASR routing...)
TRANSLATION OUTPUT Gemma 4 E2B-it
(Translation output will appear here...)
Benchmark Evidence

Verified Baseline Benchmark Data

Evidence-first verification on Host GPU (CUDA 12.4) and Android AVD emulator. Physical ARM device latency and quantization gates (G2/G3/G4-ARM) are explicitly distinguished as active pending gates.

Test ID Component Runtime Environment Lang / Pair Primary Metric Latency / Memory Status & Gate
G2-SHERPA-ONNX-06B-INT8 Qwen3-ASR-0.6B INT8 (csukuangfj2) sherpa-onnx 1.13.8 (CPU 4T) ja Norm CER 12.78% (Raw 17.74%)
Delta: +3.66% vs float16 (+40.2%)
2.86 s (mean) / Load 3.17 s [ONNX-INT8] VERIFIED
LID 100% (25/25), 5.2x faster than Nemotron
G0-QWEN3-06B-JA Qwen3-ASR-0.6B (Auto-LID) Host PyTorch CUDA 12.4 ja Norm CER 9.12% (Raw 13.52%) 1.30 s (mean) / 1.61 GB VRAM [HOST-GPU] PASS (Gate G0)
Device INT8/CoreML Pending
G4-DIRECT-S2TT-JA-EN Qwen3 ja↔en S2TT 2.04B INT4 Host PyTorch CUDA 12.4 ja → en Corpus BLEU 13.56 1.32 s (mean) / 3.95 GB VRAM [HOST-GPU] PASS (Gate G4)
Device ARM Budget ≤1.4s Target
P0-FLEURS-JA Whisper turbo (Oracle) Host CUDA 12.4 ja CER 7.38% (mean) 3.22 s (mean) / 3.18 GB VRAM [HOST-GPU] ORACLE
P0-FLEURS-EN Whisper turbo (Oracle) Host CUDA 12.4 en WER 23.28% (mean) 2.78 s (mean) / 3.18 GB VRAM [HOST-GPU] ORACLE
P1-NEMOTRON-JA Nemotron 3.5 ASR 0.6B Host ONNX INT4 CPU ja CER 17.49% (mean) 15.00 s / Load 1.80 s SUPERSEDED
Poor CPU Latency & CER
AVD-S2TT-GEMMA Gemma 4 E2B-it LiteRT-LM AVD API 34 (x86_64 Emulator) ja → en Qualitative Smoke Only (No BLEU) 15.45 s (x86 CPU) / Harness RSS 48 MB [EMULATOR] INCOMPLETE
Unverified on physical ARM NPU
AVD-NEMOTRON-LOAD Nemotron ONNX INT4 AVD API 34 (x86_64 Emulator) ja E007 Decode Crash (nemotron_speech) Load 4.95 s / RSS 106 MB FAILED (E007)
Custom RNN-T prohibited
Physical Device Reality Check:

To eliminate progress theater, we explicitly state that all primary CER and BLEU benchmarks were executed on Host GPU (CUDA 12.4). Physical on-device execution on ARM targets (iPhone Neural Engine via CoreML and Android Snapdragon/Tensor via sherpa-onnx INT8) represents active milestone gates (G2/G3/G4-ARM). Host numbers are not conflated with on-device measurements.

Integration

Developer Code Examples

Embed Green Speech LM in your Android, iOS, or Python applications.

// Android Kotlin (SpeechSession.kt)
val session = SpeechSession(SessionConfig(mode = InterpretMode.AUTOMATIC))
session.startListening()

// On utterance end with LID
val backend = session.onUtteranceEnd(LidResult(language = "ja", confidence = 0.94))
// -> backend routes to AsrBackend.NEMOTRON

// Transcribe and S2TT via Gemma 4 E2B-it
val translation = GemmaLitertLm.translate(
    modelFile = File("/data/local/tmp/speechlm/gemma-4-E2B-it.litertlm"),
    prompt = "Translate to English. Source: $transcript",
    cacheDir = File(context.cacheDir, "speechlm-litertlm")
)
session.onTranslationReady()
Model Ecosystem

Component Models Catalog

All models are used as published from official Hub repositories without unverified custom conversion.

Primary ASR (52 Langs) 0.6B Params
Qwen3-ASR-0.6B
Apache-2.0 streaming/offline ASR covering 52 languages with integrated Auto-LID tags. Verified 9.12% CER on FLEURS ja.
Hugging Face Model Card →
Guided Direct S2TT 2.04B INT4
Qwen3-ASR ja↔en S2TT
Specialized direct speech-to-text translation model. Bypasses intermediate LM decode on Guided ja↔en turns for ≤1.4s response.
Hugging Face Model Card →
MT & LM Backbone 2B Params
Gemma 4 E2B-it
Google's ultra-lightweight multilingual LLM. Handles direct S2TT reasoning, context preservation, and polite phrasing across 140+ languages.
Hugging Face Model Card →
Long-Tail ASR 300M Params
Omnilingual CTC 300M
Meta's massive language coverage CTC recognizer. Dynamically swapped in for languages outside Qwen3's 52 coverage.
Omnilingual GitHub →