# Research notes

Studies, surveys and the literature watch behind the design decisions.

!!! info "This is the engineering tier"

    These pages are written for contributors, reviewers and researchers rather
    than for people using YazSes. For the user documentation, start at
    [Home](../../index.md).

**69 documents.**

- [Idea mining: silent speech & neural interfaces (2026-08-08)](2026-08-08-silent-speech-idea-mining.md)
- [The YazSes HCI reference corpus — 105 verified references](2026-08-11-hci-reference-corpus.md)
- [The YazSes HCI research agenda — ten directions](2026-08-11-hci-research-agenda.md)
- [Adjacent open-source projects, and what is worth taking from them](2026-08-15-adjacent-projects.md)
- [Modular distribution: what a YazSes install actually costs, and how other projects solve it](2026-08-15-modular-distribution-survey.md)
- [The problem space — what a future YazSes would be for](2026-08-15-problem-space.md)
- [Futuristic Voice-First HCI Capabilities for YazSes — Research Scope](studies/yazses-future-voice-hci/input/research_scope.md)
- [State of the Art: Futuristic Voice-First HCI for YazSes — 2025](studies/yazses-future-voice-hci/output/02_soa_matrix.md)
- [Gap Analysis: Futuristic Voice-First HCI for YazSes — 2025](studies/yazses-future-voice-hci/output/03_gap_analysis.md)
- [YazSes v0.4 — Capability Prioritization Matrix](studies/yazses-future-voice-hci/output/05_prioritization_matrix.md)
- [YazSes v0.4 PRD — Offline LLM Routing, Code-Aware Dictation, EMG Backend](studies/yazses-future-voice-hci/output/06_prd.md)
- [YazSes v0.4 Architecture — Offline LLM Routing, LSP Context, EMG Backend](studies/yazses-future-voice-hci/output/07_architecture.md)
- [Use llama-cpp-python (in-process GGUF) for Tier 2 SLM inference](studies/yazses-future-voice-hci/output/adrs/adr-v04-001.md)
- [Use pygls JSON-RPC client for LSP context extraction](studies/yazses-future-voice-hci/output/adrs/adr-v04-002.md)
- [EMG backend uses USB CDC serial with hardware-agnostic message protocol](studies/yazses-future-voice-hci/output/adrs/adr-v04-003.md)
- [Offline LLM Intent Routing Layer](studies/yazses-future-voice-hci/output/capability_cards/gap-001.md)
- [Code-Aware Voice Dictation via LSP Context Injection](studies/yazses-future-voice-hci/output/capability_cards/gap-002.md)
- [EMG Silent Speech Backend](studies/yazses-future-voice-hci/output/capability_cards/gap-003.md)
- [Towards Spatial Computing: Recent Advances in Multimodal Natural Interaction for XR Headsets](studies/yazses-future-voice-hci/output/research_cards/src-001.md)
- [VoiceBench: Benchmarking LLM-Based Voice Assistants](studies/yazses-future-voice-hci/output/research_cards/src-002.md)
- [Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and LLMs](studies/yazses-future-voice-hci/output/research_cards/src-003.md)
- [Natural Multimodal Fusion-Based HRI: Voice and Deictic Posture via LLM](studies/yazses-future-voice-hci/output/research_cards/src-004.md)
- [Wireless Silent Speech Interface Using Multi-Channel Textile EMG Sensors Integrated into Headphones](studies/yazses-future-voice-hci/output/research_cards/src-005.md)
- [Typing Reinvented: Towards Hands-Free Input via sEMG](studies/yazses-future-voice-hci/output/research_cards/src-006.md)
- [Sentence-Level Silent Speech Recognition Using Wearable EMG/EEG Sensor Fusion](studies/yazses-future-voice-hci/output/research_cards/src-007.md)
- [Affective Mirroring in Video Game NPCs: A Pilot Study Evaluating Player Engagement](studies/yazses-future-voice-hci/output/research_cards/src-008.md)
- [LLM-Driven NPCs: Cross-Platform Dialogue System for Games and Social Platforms](studies/yazses-future-voice-hci/output/research_cards/src-009.md)
- [A Systematic Review of Fusion Methods for the User-Centered Design of Multimodal Interfaces](studies/yazses-future-voice-hci/output/research_cards/src-010.md)
- [Biosignal-Enabled Spoken Communication — Interspeech 2025 Special Session](studies/yazses-future-voice-hci/output/research_cards/src-011.md)
- [AI Applications for Interpreting Communicative Movements by Individuals with Visual and/or Motor Disabilities](studies/yazses-future-voice-hci/output/research_cards/src-012.md)
- [YazSes Innovation Roadmap — Research Scope](studies/yazses-innovation/input/research_scope.md)
- [YazSes Innovation — State-of-the-Art Matrix](studies/yazses-innovation/output/02_soa_matrix.md)
- [YazSes Innovation — Gap Analysis](studies/yazses-innovation/output/03_gap_analysis.md)
- [YazSes Innovation — Capability Prioritization Matrix](studies/yazses-innovation/output/05_prioritization_matrix.md)
- [YazSes v0.3.0 — Product Requirements Document](studies/yazses-innovation/output/06_prd.md)
- [YazSes v0.3.0 — Architecture Document](studies/yazses-innovation/output/07_architecture.md)
- [YazSes v0.3.0 — Evaluation Plan](studies/yazses-innovation/output/08_eval_plan.md)
- [YazSes v0.3.0 — Production Readiness Checklist](studies/yazses-innovation/output/09_production_readiness.md)
- [YazSes v0.3.0 — Build Prompt for Claude Code](studies/yazses-innovation/output/10_build_prompt.md)
- [ADR-001: Text-Only SSH Forwarding (No Audio-Over-SSH)](studies/yazses-innovation/output/adrs/adr-001.md)
- [ADR-002: LocalAgreement Policy for Streaming Partial Hypotheses](studies/yazses-innovation/output/adrs/adr-002.md)
- [ADR-003: Grammar-Rule Intent Classifier (No Dedicated Coding ASR Model)](studies/yazses-innovation/output/adrs/adr-003.md)
- [ADR-004: Correction-on-Commit via Selection-Replace](studies/yazses-innovation/output/adrs/adr-004.md)
- [ADR-005: Accessibility via Config Parameters First, LoRA Fine-Tune Second](studies/yazses-innovation/output/adrs/adr-005.md)
- [YazSes Remote — Voice Dictation Over SSH Sessions](studies/yazses-innovation/output/capability_cards/cap-001.md)
- [Streaming Transcription with Real-Time Display and Rollback Correction](studies/yazses-innovation/output/capability_cards/cap-002.md)
- [Code Command Grammar — Voice-Driven Code Editing Actions](studies/yazses-innovation/output/capability_cards/cap-003.md)
- [Offline Disfluency Filter — Clean Text Before Injection](studies/yazses-innovation/output/capability_cards/cap-004.md)
- [Accessibility Profile — Personalised Whisper Adaptation for Atypical Speech](studies/yazses-innovation/output/capability_cards/cap-005.md)
- [XR Voice API — WebSocket JSON-RPC Event Server for AR/VR/Metaverse](studies/yazses-innovation/output/capability_cards/cap-006.md)
- [Gaming Profile — Spatial Voice Commands for 3D Games and Simulation](studies/yazses-innovation/output/capability_cards/cap-007.md)
- [LLM Intent Layer — Adaptive Local LLM for Command Disambiguation](studies/yazses-innovation/output/capability_cards/cap-008.md)
- [faster-whisper: Faster Whisper transcription with CTranslate2](studies/yazses-innovation/output/research_cards/src-001.md)
- [whisper_streaming — Online Whisper STT with LocalAgreement Policy](studies/yazses-innovation/output/research_cards/src-002.md)
- [Turning Whisper into Real-Time Transcription System (arXiv 2307.14743)](studies/yazses-innovation/output/research_cards/src-003.md)
- [WhisperPipe — Low-Latency Streaming ASR with Consensus Engine (arXiv 2604.25611)](studies/yazses-innovation/output/research_cards/src-004.md)
- [WhisperX — Forced Alignment and Speaker Diarization for Whisper](studies/yazses-innovation/output/research_cards/src-005.md)
- [Serenade — Voice-Controlled IDE Plugin with Speech-to-Code Model](studies/yazses-innovation/output/research_cards/src-006.md)
- [Talon Voice — Gold Standard Hands-Free Coding with Python Scripting API](studies/yazses-innovation/output/research_cards/src-007.md)
- [Voiceitt — Personalised ASR for Atypical Speech](studies/yazses-innovation/output/research_cards/src-008.md)
- [ASR in 2025-2026: A Deep Dive — Practitioner Benchmark and Stack Comparison](studies/yazses-innovation/output/research_cards/src-009.md)
- [When to Call the LLM: Adaptive Speech Interfaces for NL Input in XR (ACM VRST 2025)](studies/yazses-innovation/output/research_cards/src-010.md)
- [Human–3D Object Interaction Through Voice Commands in Immersive VR (MDPI 2025)](studies/yazses-innovation/output/research_cards/src-011.md)
- [Back to Basics: Revisiting ASR in the Age of Voice Agents (arXiv 2603.25727)](studies/yazses-innovation/output/research_cards/src-012.md)
- [Superwhisper — Local Whisper Dictation with LLM Post-Processing and Per-App Profiles](studies/yazses-innovation/output/research_cards/src-013.md)
- [Towards Spatial Computing: Multimodal Natural Interaction for XR Headsets (Frontiers of CS, Springer 2025)](studies/yazses-innovation/output/research_cards/src-014.md)
- [A2-LLM: End-to-End Conversational Audio Avatar LLM (arXiv 2602.04913)](studies/yazses-innovation/output/research_cards/src-015.md)
- [ASR for Non-Native English: Accuracy and Disfluency Handling (arXiv 2503.06924)](studies/yazses-innovation/output/research_cards/src-016.md)
- [Research digest — 2026-08-15](watch/2026-08-15-digest.md)
