【開発裏話】バージョン1.2 リリース秘話:音声認識エンジンの刷新と「リスニングモード」搭載!
今まで公式サイトのページにひっそりと掲載していた「開発裏話」のバージョン1.2部分の内容を、少し加筆した上でこちらの note に移行します。
爆速でバージョン1.2をリリースいたしました!(2026/7/17)
未だダウンロード数は 1(自分) のため、どなたからのフィードバックも受けていない状況ではありますが、個人的に思うところを全力で改善しました。
🎧 新機能「リスニングモード」の追加
今回の大きなアップデートとして、「リスニングモード」を追加しました。 これはユーザが一切話すことなく、ラジオやポッドキャストのように会話が自動進行するものです(フリートークの代読機能を拡張)。初めてアプリを使う方や、電車内での利用、ながら聞きなどを想定したモードとなっています。
🎙️ STT/TTS周りの大幅な機能強化・エンジンの刷新
音声認識や合成(STT/TTS)周りに関しても、妥協することなく大幅な機能強化と改善を行いました。
音声認識エンジンの変更(Vosk ➔ Sherpa-onnx) 認識精度・速度が劇的に向上し、さらに US/UK/AU 発音への対応が可能となりました。
シチュエーションごとの地域設定 シチュエーションごとに地域(US/UK/AU)を設定し、地域にあった STT 結果の補正・TTS ボイスの選択を自動で行うようにしました。
音声認識結果の確認・やり直し機能の搭載 思うように音声認識がされなくてお困りの方向けに、音声認識されたテキストを会話に送信される前にいったん確認し、修正ややり直しができる機能を搭載しました。
🚀 ノンストップで進化は続く
今回もいつも通り、スムーズに審査を通していただきました。 そして今回もまた、審査待ちの間にノンストップで次なる「v1.3」の開発に着手しました。
v1.3では更なる進化を予定しています!
