Read this in other languages: English · Deutsch · Nederlands · Tiếng Việt · Türkçe · bahasa Indonesia · español · français · italiano · polski · português do Brasil · svenska · čeština · ελληνικά · Русский · українська · اردو · العربية · فارسی · हिंदी · বাংলা · தமிழ் · తెలుగు · ไทย · 日本語 · 简体中文 · 繁體中文 · 한국어
YazSes¶
YazSes என்பது Linux, macOS மற்றும் Windows ஆகியவற்றில் இயங்கும் குரலை எழுத்து வடிவமாக மாற்றும் கருவி. இணைய இணைப்பு தேவையில்லை; இது உங்கள் கணினியிலேயே செயல்படும். ஒரு விசையை அழுத்திப் பிடித்து பேசுங்கள். பிறகு விசையை விடும்போது, faster-whisper உங்கள் சாதனத்திலேயே பேச்சை எழுத்து வடிவமாக மாற்றி, நீங்கள் பயன்படுத்தும் செயலியில் நேரடியாகத் தட்டச்சு செய்யும். கிளவுட் இல்லை. API key தேவையில்லை. சந்தாவும் இல்லை. எந்தத் தரவும் உங்கள் கணினியை விட்டு வெளியே செல்லாது.
ஏன் YazSes?¶
- இணைய இணைப்பு இல்லாமலேயே இயங்கும்; உங்கள் தனியுரிமையும் பாதுகாக்கப்படும்
உங்கள் சாதனத்தின் CPU-வில் இயங்கும் faster-whisper (int8) மூலம் பேச்சு எழுத்தாக மாற்றப்படுகிறது. GPU, இணைய இணைப்பு அல்லது கணக்கு எதுவும் தேவையில்லை. ஒலிப்பதிவோ, எழுத்து உள்ளடக்கமோ உங்கள் கணினியை விட்டு வெளியே செல்லாது.
- எந்தச் செயலியிலும் நேரடியாகத் தட்டச்சு செய்யலாம்
ஒரு விசையை அழுத்திப் பிடித்து பேசுங்கள்; பேசி முடித்ததும் விசையை விடுங்கள். நீங்கள் பயன்படுத்தும் செயலி editor ஆக இருந்தாலும், browser, terminal அல்லது chat ஆக இருந்தாலும், எழுத்து நேரடியாக அதில் தோன்றும். X11 மற்றும் Wayland இரண்டிலும் இது இயங்கும்.
- SSH மற்றும் Remote-SSH வழியாகவும் பயன்படுத்தலாம்
YazSes ஒரு குறிப்பிட்ட செயலிக்குள் மட்டும் இயங்குவதில்லை; OS மட்டத்தில் எழுத்தை உள்ளிடுகிறது. அதனால் VS Code / Cursor Remote-SSH panes, integrated terminals, tmux மற்றும் container shells போன்றவற்றிலும் இதைப் பயன்படுத்தலாம். பொதுவாக ஒரு செயலிக்குள் மட்டுமே இயங்கும் dictation கருவிகளால் இவற்றை அணுக முடியாது.
- குரல் கட்டளைகள் மற்றும் macros
regex இலக்கணம் மூலம் “undo that”, “save file”, “go to line 42” போன்ற குரல் கட்டளைகளை உண்மையான key sequences ஆக மாற்றி செயல்படுத்தலாம்.
- ஒலிப்பதிவுகளை எழுத்தாக மாற்றலாம்
yazses transcribe meeting.m4a கட்டளையைப் பயன்படுத்தி எந்த audio/video கோப்பையும் இணைய இணைப்பு இல்லாமலேயே எழுத்தாக மாற்றலாம். --diarize மூலம் யார் பேசுகிறார்கள் என்பதையும் தனித்தனியாகக் குறிப்பிடலாம்; subtitles-ஐயும் export செய்யலாம்.
- அனைவரும் எளிதாகப் பயன்படுத்தும் வகையில் வடிவமைக்கப்பட்டுள்ளது
VAD calibration, mic-level tuning, dysfluency-friendly mode மற்றும் EMG muscle-sensor trigger போன்ற அம்சங்கள் இதில் உள்ளன. இதனால் கைகளைப் பயன்படுத்தாமலேயே YazSes-ஐ இயக்க முடியும்.
- உங்கள் தேவைக்கேற்ப தானாக மேம்படுத்திக்கொள்ளும்
விருப்பத்துடன் இயக்கக்கூடிய, குறியாக்கம் செய்யப்பட்டு சாதனத்திலேயே சேமிக்கப்படும் learning corpus மூலம், உங்கள் சொந்தத் திருத்தங்களைப் பயன்படுத்தி yazses tune துல்லியத்தை மேம்படுத்துவதற்கான பரிந்துரைகளை வழங்கும்.
நிறுவல்¶
| தளம் | நிறுவல் கட்டளை |
|---|---|
| Linux | bash <(curl -fsSL https://raw.githubusercontent.com/MSKazemi/yazses/main/install.sh) |
| எந்த இயங்குதளமும் (Python ≥ 3.11) | pipx install yazses |
| Linux (Debian/Ubuntu) | bash <(curl -fsSL https://raw.githubusercontent.com/MSKazemi/yazses/main/install-apt.sh) |
Snap அல்ல
கட்டுப்படுத்தப்பட்ட Snap-ல் X11-ல் மட்டுமே dictation செயல்படும். Wayland-ல் பயன்படுத்த, மேலே உள்ள APT script அல்லது pipx முறையைப் பயன்படுத்துங்கள். விசை உள்ளீட்டைச் செலுத்தத் தேவையான host ydotoold service-ஐ Snap-ஆல் configure செய்யவோ பயன்படுத்தவோ முடியாது.
X11-ல் நிறுவிய பிறகு, தேவையான இரண்டு interfaces-ஐ இணைக்கவும்:
sudo snap install yazses
sudo snap connect yazses:audio-record
sudo snap connect yazses:raw-input
yazses doctor
Snap பதிப்புக்கு yazses setup தேவையில்லை. அதன் confinement காரணமாக host packages-ஐ நிறுவவோ, groups-ஐ மாற்றவோ, host services-ஐ configure செய்யவோ முடியாது. அதற்குப் பதிலாக, தேவைப்படும் permissions பற்றிய manual checklist-ஐ மட்டுமே அது காட்டும். X11-க்குத் தேவையான dependencies Snap-இலேயே சேர்க்கப்பட்டுள்ளன.
Snap அல்லாத Linux நிறுவல்களில், ஒரே கட்டளையில் system setup செய்யலாம்:
yazses setup # audio + injection dependencies-ஐ நிறுவி, input group-ல் சேர்த்து, ydotoold-ஐ அமைக்கிறது
# அதன் பிறகு logout செய்து மீண்டும் login செய்யவும் (input-group மாற்றத்திற்கு புதிய login தேவை)
இந்தக் கட்டளை libportaudio2 (audio), X11/Wayland injection tools ஆகியவற்றை நிறுவி, உங்களை input group-ல் சேர்க்கும். மேலும், GNOME/KDE Wayland-ல் wtype தடுக்கப்படுவதால், விசை உள்ளீட்டைச் செலுத்தும் ஒரே வழியான ydotoold-ஐ அமைக்கும். இதை எப்போது வேண்டுமானாலும் மீண்டும் இயக்கலாம்; தேவையான மாற்றங்களை மட்டுமே அது செய்யும்.
அதன் பிறகு:
yazses doctor # mic, injection backend, permissions ஆகியவற்றைச் சரிபார்க்கவும்
yazses enroll # microphone-ஐ calibrate செய்யவும் (~30 s)
yazses start # dictation daemon-ஐ தொடங்கவும்
Linux-ல் Right Alt, macOS-ல் Right Option, Windows-ல் Right Ctrl விசையை அழுத்திப் பிடித்து பேசுங்கள். பேசி முடித்ததும் விசையை விடுங்கள். சுமார் ஒரு வினாடிக்குள், focus-ல் உள்ள செயலியில் எழுத்து தோன்றும்.
முதல் முறை இயக்கும்போது ஒரு பேச்சு மாதிரி (சுமார் 148 MB) ஒருமுறை பதிவிறக்கம் செய்யப்படும். அதன்பிறகு இணையமே தேவையில்லை.
மக்கள் இதை எதற்காகப் பயன்படுத்துகிறார்கள்¶
- Linux-ல் குரல் மூலம் தட்டச்சு — X11, Wayland இரண்டிலும் இயங்கும் dictation
- Wayland-ல் குரல் மூலம் dictation — GNOME, KDE Plasma, sway, Hyprland மற்றும் terminals உட்பட
- ரகசியமான, இணைய இணைப்பு இல்லாத வேலைகள் — மருத்துவம், சட்டம், air-gapped சூழல்கள்
- குரல் மூலம் coding — spoken symbols, identifiers, LaTeX, git
- குரல் மூலம் கட்டுப்படுத்துதல் — commands, macros, hands-free actions
- அணுகல்தன்மை மற்றும் RSI — hands-free பயன்பாடு, dysfluency-friendly செயல்பாடு
- ஒலிப்பதிவுகளை எழுத்தாக மாற்றுதல் — இணைய இணைப்பு இல்லாமல், speaker labels உடன்
- code-ஐ குரல் மூலம் dictation செய்வது — identifiers, jargon, punctuation உட்பட
- model-ஐத் தேர்வு செய்தல் — அளவிடப்பட்ட accuracy மற்றும் latency அடிப்படையில்
- platform support — உங்கள் OS மற்றும் CPU-ல் இது இயங்குமா?
- capability matrix — எந்த இடத்தில் எந்த features வேலை செய்கின்றன, ஏன் வேலை செய்யவில்லை
- settings window — config file இல்லாமல், ஒவ்வொரு capability-யையும் checkbox மூலம் அமைக்கலாம்
- ஒன்றுக்கும் மேற்பட்ட மொழிகள் — English அல்லாத மொழிகள் மற்றும் code-switching
அனைத்து use cases-ஐப் பார்க்கவும்
எப்போது இதைப் பயன்படுத்தக் கூடாது¶
YazSes ஒரு LLM agent அல்ல. இது உங்கள் பேச்சை எழுத்தாக மாற்றி, editor மற்றும் terminal commands-ஐ இயக்கும். ஆனால் இணையத்தில் தேடவோ, உங்கள் files-ஐ ஆராய்ந்து reasoning செய்யவோ, உரையாடலைத் தொடர்ந்து நடத்தவோ முடியாது. இது CPU-ல் faster-whisper-ஐப் பயன்படுத்துகிறது. சத்தம் அதிகமான microphone-ல் raw accuracy-ஐ மட்டும் ஒப்பிட்டுப் பார்த்தால், cloud service இன்னும் சிறப்பாக இருக்கலாம். மேலும், இது இயல்பாக English-க்கு tune செய்யப்பட்ட *.en models-ஐப் பயன்படுத்துகிறது; desktop-ல் மட்டுமே இயங்கும்.
இது எப்படி வேலை செய்கிறது¶
Hold hotkey → record audio → VAD gate → faster-whisper (CPU)
→ clean + disfluency filter → command இலக்கணம் (Tier 1 regex)
→ dictate? type it · command? send keys
YazSes என்ன செய்கிறது என்பதை உடனடியாகப் புரிந்துகொள்ள இரண்டு indicators உள்ளன. மேல்பட்டியில் இருக்கும் "Y" tray icon-ன் நிறம், அதன் தற்போதைய நிலையை நேரடியாகக் காட்டும் (🔵 idle · 🟢 dictating · 🟡 text target இல்லை → clipboard · 🟣 command mode · 🔴 problem). விரும்பினால் sonar overlay-ஐயும் இயக்கலாம்; YazSes listening செய்யும் போது அது உங்கள் cursor அருகில் pulse ஆகும். ஒவ்வொரு நிறத்தின் அர்த்தத்தையும் Tray icon & overlay பகுதியில் பார்க்கலாம்.
YazSes CLI-யைப் பற்றிய விளக்கத்தை மட்டும் படிக்காமல், அது எப்படி இயங்குகிறது என்பதை நேரடியாகப் பார்க்க விரும்புகிறீர்களா? இங்கேயே அதை இயக்கிப் பாருங்கள் — -h → about → quickstart → features → status ஆகியவற்றைக் காட்டும் உண்மையான asciinema recording. அதில் உள்ள text-ஐத் தேர்ந்தெடுத்து copy-paste செய்யலாம். அல்லது உங்கள் terminal-ல்:
ஆவணங்கள்¶
- Linux-ல் நிறுவுதல் · macOS · Windows
- CLI reference — அனைத்து commands மற்றும் flags
- Configuration —
config.toml-ன் அனைத்து sections - Features மற்றும் v2 preview
- Comparison & alternatives — Talon, Dragon, Wispr Flow ஆகியவற்றுடனான ஒப்பீடு
- FAQ — பொதுவான கேள்விகளுக்கான பதில்கள்
- Architecture மற்றும் diagrams
- Troubleshooting மற்றும் roadmap
- Research — eye, voice மற்றும் muscle input குறித்த மேற்கோள்களுடன் கூடிய அறிவியல் ஆய்வுகள்
- Student & research projects — thesis அளவிலான problems மற்றும் open issues
இது ஏன் இப்படி வேலை செய்கிறது என்று ஆர்வமா?
[research section](research/index.md) என்பது keyboard-க்குப் பிறகான
input குறித்த public, fully-cited notebook. Webcam eye tracking உண்மையில்
எவ்வளவு துல்லியமானது, offline speech recognition எவ்வாறு cloud-ஐ முந்தியது,
மேலும் $50 muscle sensor எப்படி $1,000 EEG headset-ஐவிடச் சிறப்பாகச்
செயல்படுகிறது என்பதையும் இதில் பார்க்கலாம். YazSes-ன் ஒவ்வொரு design
decision-உம் அங்குள்ள measurements-ஐ அடிப்படையாகக் கொண்டது. மேலும்,
open questions-க்கு யார் வேண்டுமானாலும் பங்களிக்கலாம்.
FAQ¶
இணைய இணைப்பு இல்லாமலும் இது இயங்குமா? ஆம் — transcription சாதனத்திலேயே நடைபெறும்; இயல்பாக எந்தத் தகவலும் வெளியே அனுப்பப்படாது.
எனக்கு எந்த GPU தேவை? எதுவும் தேவையில்லை. இது CPU-லேயே இயங்கும். குறைந்தபட்சம் 4 GB RAM தேவை; 8 GB இருந்தால் இன்னும் வசதியாக இருக்கும்.
Wayland-ல் இது இயங்குமா? ஆம். APT அல்லது pipx installation மூலம் பயன்படுத்தலாம் (wtype/ydotool பயன்படுத்துகிறது). இவற்றில் ஒன்றைப் பயன்படுத்துங்கள்; Snap-ஐத் தவிர்க்கவும். Snap-ன் strict confinement காரணமாக, host injection service-ஐ அதனால் பயன்படுத்த முடியாது. எனவே Wayland applications-ல் result-ஐ type செய்ய முடியாது.
Talon-க்கு இது மாற்றா? YazSes இணைய இணைப்பு இல்லாத dictation மற்றும் நடைமுறைக்கு ஏற்ற command இலக்கணம் ஆகியவற்றில் கவனம் செலுத்துகிறது. Talon-ல் மிகவும் advanced scripting capabilities உள்ளன. இரண்டையும் ஒன்றாகப் பயன்படுத்தலாம்.
மேலும் பதில்களுக்கு full FAQ-ஐப் பார்க்கவும். Comparison & alternatives பகுதியில் side-by-side comparison உள்ளது.
Apache-2.0 license-ன் கீழ் வெளியிடப்பட்டுள்ளது. YazSes உங்களுக்குப் பயனுள்ளதாக இருந்தால், GitHub-ல் ⭐ கொடுங்கள். இதனால் மற்றவர்களும் இதைக் கண்டுபிடிக்க உதவும்.
பங்களிக்க விரும்புகிறீர்களா? Contributing பகுதியைப் பார்க்கவும் — README-ஐ மொழிபெயர்ப்பது, நீங்கள் ஏற்கனவே பயன்படுத்தும் config-ஐப் பகிர்வது, உங்களுக்கு நன்றாக வேலை செய்த microphone-ஐச் சேர்ப்பது போன்ற code தேவையில்லாத பல பணிகளும் உள்ளன.
தனியுரிமை¶
ஒலி உங்கள் கணினியிலேயே எழுத்தாக மாற்றப்படுகிறது; அது எங்கும் அனுப்பப்படுவதில்லை. தொலைஅளவீடு இல்லை; மேகக்கணிக்கான பாதையும் இல்லை.
மேலும்¶
மீதமுள்ள ஆவணங்கள் தற்போது ஆங்கிலத்தில் மட்டுமே உள்ளன.