見出し画像

【開発裏話】バージョン1.2 リリース秘話:音声認識エンジンの刷新と「リスニングモード」搭載!

今まで公式サイトのページにひっそりと掲載していた「開発裏話」のバージョン1.2部分の内容を、少し加筆した上でこちらの note に移行します。


爆速でバージョン1.2をリリースいたしました!(2026/7/17)

未だダウンロード数は 1(自分) のため、どなたからのフィードバックも受けていない状況ではありますが、個人的に思うところを全力で改善しました。

🎧 新機能「リスニングモード」の追加

今回の大きなアップデートとして、「リスニングモード」を追加しました。 これはユーザが一切話すことなく、ラジオやポッドキャストのように会話が自動進行するものです(フリートークの代読機能を拡張)。初めてアプリを使う方や、電車内での利用、ながら聞きなどを想定したモードとなっています。

🎙️ STT/TTS周りの大幅な機能強化・エンジンの刷新

音声認識や合成(STT/TTS)周りに関しても、妥協することなく大幅な機能強化と改善を行いました。

  • 音声認識エンジンの変更(Vosk ➔ Sherpa-onnx) 認識精度・速度が劇的に向上し、さらに US/UK/AU 発音への対応が可能となりました。

  • シチュエーションごとの地域設定 シチュエーションごとに地域(US/UK/AU)を設定し、地域にあった STT 結果の補正・TTS ボイスの選択を自動で行うようにしました。

  • 音声認識結果の確認・やり直し機能の搭載 思うように音声認識がされなくてお困りの方向けに、音声認識されたテキストを会話に送信される前にいったん確認し、修正ややり直しができる機能を搭載しました。

🚀 ノンストップで進化は続く

今回もいつも通り、スムーズに審査を通していただきました。 そして今回もまた、審査待ちの間にノンストップで次なる「v1.3」の開発に着手しました。

v1.3では更なる進化を予定しています!

いいなと思ったら応援しよう!