見出し画像

Gemma 3n の 音声入力機能 の概要

以下の記事が面白かったので、簡単にまとめました。

Google AI Edge Gallery: Now with audio and on Google Play


1. はじめに

Google I/Oカンファレンスでは、テキストと画像入力を可能にした「Gemma 3n」のプレビュー版を公開するとともに、「Google AI Edge Gallery」をGitHubでリリースしました。このオープンソースのインタラクティブな開発者向けアプリは、デバイス上で動作するAIモデルを活用したアプリケーション開発を支援するために設計されており、実践的なサンプルコード、透明性の高い性能指標、そして必要なドキュメントへのリンクなどを提供することで、開発者の創造性を刺激し、開発を促進することを目的としています。開発者コミュニティからの反響は素晴らしく、わずか2ヶ月でAPKのダウンロード数が50万回に達しました。

そして本日、「Google AI Edge Stack」への音声入力機能の追加と、「Google AI Edge Gallery」のGoogle Playストアでの提供を開始しました。

2. Gemma 3n の音声入力機能

「Google AI Edge Stack」は、テキストや画像処理に加え、音声入力にも対応しました。この機能に対応した最初のモデルは「Gemma 3n」で、AndroidおよびWeb向けMediaPipe LLM推論APIから利用可能です。
具体的には以下の機能が利用可能になります。

・高品質な音声認識:様々な言語の音声データをテキストに変換
・音声翻訳:音声データを別の言語のテキストに翻訳

今回のリリースでは、MediaPipe LLM推論APIは最大30秒の音声データに対するバッチ推論をサポートしています。今後、ストリーミング音声への対応も予定しています。

3. Google AI Edge Gallery を試す

Google AI Edge Gallery」に音声入力機能を追加しました。この機能を使えば、音声ファイルをアップロードするか、デバイスのマイクを使って録音し、「Gemma 3n」がその場で音声データをテキストに変換する様子を、インターネット接続なしでスマートフォン上で確認できます。

4. Google PlayストアでGoogle AI Edge Gallery を公開

「Google AI Edge Gallery」をGoogle Playストアでオープンベータ版として提供開始しました。コードは引き続きGithubで公開されているため、Playストアから手軽にデモを体験できるだけでなく、GitHubでソースコードを詳細に確認することも可能です。

5. 今後の展開

「Google AI Edge Gallery」を、デバイス上で動作するAI技術の、最も刺激的で役立つ情報発信プラットフォームにすることを目指しています。今後数ヶ月間には、以下の取り組みを進める予定です。

・iOSアプリのリリース
「Google AI Edge」の生成AI機能 (RAG(Retrieval Augmented Generation)やデバイス内での関数呼び出しなど) を活用した、より多くのサンプルアプリケーションを紹介する。

・完全オープンソースのLLMランタイムであるLiteRT-LMへの移行
コミュニティと連携し、より多くのオープンソースモデルをHuggingFace LiteRTコミュニティに変換、最適化、公開し、アプリに統合していきます。


いいなと思ったら応援しよう!