見出し画像

【プレスリリース】 Aivis Cloud API 正式リリースのお知らせ

2026年1月22日
株式会社Walkers

久しぶりのお知らせになりますが、Aivis Cloud API を、2026年2月1日に正式リリースいたします。
Aivis Cloud API は、高速かつ高品質な日本語音声合成を、クラウドで利用できる API サービスです。
AivisSpeech Engine と異なりローカル環境への GPU 導入が不要で、API キーを発行するだけですぐにご利用いただけます。

2025年7月の無料ベータ版公開から約半年間、多くの方にご利用いただき、貴重なフィードバックをいただきながら、機能の充実と安定性の向上に取り組んでまいりました。
特に GPU サーバーの安定運用には試行錯誤を重ねました。
ベータ版公開当初は VRAM メモリリークによるサーバー再起動が頻発しておりましたが、推論エンジンの根本的な見直しと負荷分散の最適化を経て、現在は2ヶ月以上の連続安定稼働を実現しています。

2026年2月1日より有料プランの提供を開始し、本格的な商用利用に対応いたします。

【2026年3月追記】

Aivis Cloud API の料金プランや技術仕様など、さまざまなご質問をまとめた「よくある質問 / Q&A」ページを公開しました!

料金プランから、従量課金・サブスクリプションの違い、音声合成の仕様、ユーザー辞書、AIVM 仕様、AivisSpeech との違い、セキュリティ、データ保護…などなど、実際に過去お問い合わせいただいた内容を参考に、技術的な説明まで詳細に掲載しております。お困りの際はぜひ一度ご参照ください!


■ 主な特長

【圧倒的な生成速度】

最速 0.3 秒で音声生成を開始し、2 秒程度の音声(約 15 文字)であればほぼ瞬時に生成が完了します。
30 秒程度の音声(約 230 文字)でも最短 0.7 秒以下で生成可能です。

さらに、生成音声のストリーミング再生に対応します。
生成完了を待たずに最短 0.3 秒で音声の再生を開始でき、LLM と組み合わせたリアルタイム AI チャットにおいて、体感遅延を大幅に削減できます。

以下の「リアルタイム音声合成デモ」にて、まずはリアルタイム音声合成の圧倒的な速度と品質をぜひお試しください!
デモページのソースコードはすべて HTML ページ内に含まれていますので、リアルタイムストリーミング実装の参考としてもご活用いただけます。


【最大3,000文字の一括生成に対応】

最大3,000文字までのテキストから、音声を一括で生成できます。

AivisSpeech Engine は設計上の制約により、実用上500文字程度までしか一度に生成できません。
また、VOICEVOX ENGINE API との互換性を保つ関係上、AivisSpeech Engine の API を使い長時間の音声を生成するには、テキストを分割して生成した上で、WAV ファイルを自前で結合するといった煩雑な処理が必要でした。

Aivis Cloud API では、こうしたテキストの分割処理や音声の結合を、テキストごとに最適な位置で自動実行します。
最大3,000文字(数十分相当)のテキストを音声合成 API に送るだけで、煩雑な実装なしに、自然なつながりの音声ファイルを一括生成・ダウンロードできます。


【プライベートモデルで、あなただけの音声合成 API を】

事前にアップロードしたプライベートモデル(非公開モデル)をクラウド API で利用できます!
音声合成モデルファイル (.aivm / .aivmx) を非公開でアップロードいただければ、お手持ちのプライベートモデルを、音声を最速 0.3 秒で生成できる Aivis Cloud API 上でご活用いただけます。

自社キャラクターでの AI ボイス、AI チャットボットの構築や、各種サービスへのボイス機能の組み込みなど、幅広い用途にご活用いただけます。
音声合成モデルのアップロード完了後、最大 5 分程度で API から利用できるようになります。


💡 プライベートモデルの制作方法について

Aivis Cloud API では、Style-Bert-VITS2 で制作した音声合成モデルを AIVM Generator で .aivm / .aivmx 形式に変換することで、プライベートモデルとしてご利用いただけます。

Aivis Cloud API では、内部的に AIVM 形式のモデルファイルを使い音声合成を行います。 一方 AivisSpeech では、AIVMX 形式のモデルファイルにのみ対応しています。

2026年中に、お手元の録音素材から、かんたん操作で高品質な音声合成モデルを制作できる「AivisBuilder」のリリースを予定しております。
しかしながら開発リソースの関係で、現時点ではまだリリースに至っておりません。現時点でプライベートモデルを自作される場合には、以下のいずれかの方法をご検討ください。

  1. NVIDIA GPU 搭載 PC で Style-Bert-VITS2 の Web UI を使って音声合成モデルを制作した後、AIVM Generator を使い生成した .aivm / .aivmx ファイルをアップロード

    • Style-Bert-VITS2 での音声合成モデル制作には、基本的に NVIDIA GPU 搭載の Windows / Linux PC が必要となり、ある程度のパソコン知識や技術的なスキルが求められます。

    • NVIDIA GPU をお持ちでない場合は、Google Colaboratory での制作も可能ですが、こちらはさらに高度な知識が必要になります。

    • Style-Bert-VITS2 は弊社開発のソフトウェアではないため、操作方法やトラブルに関するサポートは提供しておりません。

  2. 弊社の「まるなげボイス(音声合成モデル制作代行)」サービスをご利用いただき、納品された .aivm / .aivmx ファイルをアップロード

    • AivisBuilder のリリースまでの間、『1モデルあたり一括 15 万円(税込)』の均一料金にて、音声合成モデルの制作代行を承っております。

    • 音声データをお預けいただくだけで、面倒な作業は全てお任せ。
      Aivis Cloud API や AivisSpeech で確実に使える高品質な音声合成モデルを制作いたします。ぜひ お問い合わせ ください。


【高度なユーザー辞書機能を完備】

人名・地名・専門用語など固有名詞の読み間違いを防ぐ、高度な ユーザー辞書機能 を完備します。(UI 画面は 2026/02/01 リリース予定)

日本語の読み/アクセント間違いは、製品の信頼を損なう致命的な問題です。 しかし、最近主流の LLM ベースの音声合成技術では、読み・アクセントの推定が完全に LLM 側に委ねられており、ブラックボックス化しています。
そのため、ユーザー辞書などで特定の単語の読み方・アクセントを細かく調整することが、構造的に困難です。

実際、海外ビッグテックによる最新鋭の音声合成 API でも、日本語においては以下のような固有名詞の読み上げで、読み間違いが頻発している現状があります。

  • 芸能人の名前(「向井理」「新田真剣佑」など)

  • 難読地名(「中百舌鳥」「喜連瓜破」など)

  • 当て字、キャラクター名など

  • 同形異音語(「大分県(おおいたけん)/大分(だいぶ)」「国立駅(くにたちえき)/国立大学(こくりつだいがく)」)

Aivis Cloud API のユーザー辞書機能では、AivisSpeech 同様に、単語の読み仮名だけでなく、東京式アクセントのアクセント型、品詞分類、10段階の単語優先度まで詳細に設定できます。
Cloud API ダッシュボードと API の両方から、ユーザー辞書の追加・変更・削除が可能です。

複合語のアクセント指定にも対応しています。
苗字と名前セットの人名表記(例:「新田(あ↘︎らた)/真剣佑(ま↗︎っけ↘︎んゆう)」)、複合語(「し↗︎かのこの↘︎このこ/こ↘︎し/た↗︎んたん」)の両方を、正しいアクセントで読み上げるよう細かく調整することが可能です。

さらに、マルチテナント対応により、複数のユーザー辞書を管理できます。 企業や部署ごとの業界用語や社内用語に合わせて、より柔軟でカスタマイズ性の高い音声合成アプリケーションを作成できます。
音声合成 API リクエストごとに、別々のユーザー辞書の適用が可能です。

このほか、AivisSpeech のユーザー辞書(読み方&アクセント辞書)からのインポート・エクスポートにも対応しています!
お手元の AivisSpeech にて地道に調整してきたユーザー辞書を、そのまま Aivis Cloud API にインポートできます。


【美麗なダッシュボード UI で、 API の利用状況を一目で把握】

Aivis Cloud API では、API の利用状況を直感的に把握できる、洗練されたダッシュボード/アナリティクス画面をご用意しています。
期間内のリクエスト数・消費文字列・消費クレジットを、視覚的にわかりやすいグラフで確認できます。

  • 最大60日間分のデータを表示:
    長期的なトレンドを把握し、サービスの成長を可視化できます。

  • 日別・時間別の切り替え表示:
    詳細な時間帯別の利用パターンを分析し、ピーク時間の把握やリソース最適化に活用できます。

  • API キーごとの絞り込み:
    複数の API キーを発行している場合でも、それぞれの利用状況を個別に確認できます。

数字の羅列ではなく、美しいグラフ表示で、あなたのサービスの成長を実感していただけます。


【SSML に対応し、既存システムからの移行に最適】

Aivis Cloud API は、SSML(Speech Synthesis Markup Language)のサブセットに対応しています。

旧世代の音声合成サービス(Google Cloud Text-to-Speech や Amazon Polly など)では SSML 対応が主流ですが、最近主流の LLM ベースの音声合成サービスでは、SSML に対応していないケースも見られます。
Aivis Cloud API は SSML に対応しているため、SSML を活用していた既存システムからの移行を、最小限のコストでスムーズに実現できます。

ℹ️ 現在対応している SSML タグの詳細:

  • 1. <break> タグ(無音区間の挿入)

  • 2. <sub alias="..."> タグ(単語の読み方を指定)

  • 3. <prosody> タグ(話速・ピッチ・音量の制御)

    • a. <prosody rate="..."> 属性(話速制御)

    • b. <prosody pitch="..."> 属性(ピッチ制御)

    • c. <prosody volume="..."> 属性(音量制御)

    • d. <prosody aivis:tempo-dynamics="..."> 属性(テンポの緩急制御・独自拡張)

  • 4. <aivis:emotion> タグ(スタイルと感情表現の強さの指定・独自拡張)

    • a. <aivis:emotion style="..."> 属性(スタイルの指定)

    • b. <aivis:emotion intensity="..."> 属性(スタイルの強さの指定)

  • 5. <p>, <s> タグ(段落/文の分割)

現在サポートされていない要素(<emphasis>, <phoneme> など)は読み上げ時に単に無視されるため、非対応の SSML タグがそのまま読み上げられることはありません。
また、use_ssml: false を指定し、SSML パーサーを無効にすることもできます。

LLM で生成した長文テキストから音声を生成する際は、LLM に SSML 形式で出力させると話速・音量・無音区間などを細かく制御でき、より柔軟で表現豊かな音声合成を行えます。


【多様な音声フォーマットに対応】

WAV / FLAC / MP3 / AAC / Opus の 5 形式に対応します。
サンプリングレート、ビットレート、チャンネル数(モノラル / ステレオ)を細かく設定でき、リアルタイムストリーミングから高音質アーカイブまで幅広い用途に対応します。

リアルタイムにストリーミング再生を行う際は、比較的再生互換性が高くストリーミング再生に対応している MP3 形式をおすすめします。
MP3 形式はエンコード処理が比較的高速で、低遅延なストリーミング再生が可能です。 WAV 形式はエンコード処理こそ高速ですがファイルサイズが巨大なため、リアルタイム用途には不向きです。

さらに、各テキストセグメントの音量を簡易 RMS ベースでノーマライズする設定 (use_volume_normalizer) がデフォルトで有効化されています。
通常、出力音声の音量は音声合成モデルや推論ごとにばらつきがあります。 この設定をオンにすると、どのような音声合成モデルでも標準的な音量に整えることができます。


【英単語やローマ字の読み上げ、日時・単位の自動認識に対応】

Aivis Cloud API や AivisSpeech には、英単語・ローマ字・記号混じりのテキストを自然に読み上げるための、高度な正規化処理が搭載されています。


《1. 英単語やローマ字をカタカナ英語で読み上げ》

ChatGPT, Sam Altman, Anthropic, OpenCode といった英語の固有名詞、人名、CamelCase で接続された複合語も、日本語として自然な「カタカナ英語」で読み上げます。
また、「SHIBUYA」「Ebisu」「Osaki」などのローマ字綴りや、英単語とローマ字綴りが混ざった文章も適切に読み上げます。

最近主流の LLM ベースの音声合成技術では、多言語対応ゆえに文中に含まれる英単語だけ突然ネイティブな発音になりがちで、日本語としては違和感があります。
一方、Aivis Cloud API では一貫して「日本語としての読み方(カタカナ英語)」で読み上げるため、日本語のコンテンツに違和感なく馴染みます。

大量かつ複数のデータソースを信頼度順にマージした単語辞書に加え、機械学習ベースの英語→カタカナ推定を組み合わせることで、辞書に存在しない造語や新しい固有名詞にも高精度に対応します。


《2. 技術用語・略語への対応》

cuSPARSELt → シーユースパースエルティー、LPDDR5 → エルピーディーディーアールファイブ、PCIe → ピーシーアイイーなど、技術文書に頻出する略語や専門用語も正しく読み上げます。
手動で網羅した技術用語辞書に加え、CamelCase の自動分割、複数形・所有格の処理、「GPT-4」「iPhone 11」のような英単語+数字パターンの自動認識など、複雑な表記にも対応しています。

一例として、日本語の日常会話で「12 (トゥエルブ)」以上の数字を英語読みする機会はかなり稀なことから、
「Pixel 7」「iPhone 11」までは「ピクセルセブン」「アイフォンイレブン」、
「iPhone 12」「iPhone 15」は「アイフォンジュウニ」「アイフォンジュウゴ」と読まれるようにチューニングしています。


《3. 日付・時刻・単位・通貨の自動認識》

「2026/01/01」「14:30」「100GB」「¥1,980」といった表記を自動認識し、「2026年1月1日」「十四時三十分」「100ギガバイト」「1980円」のように自然な日本語として読み上げます。

和暦の省略表記(R6.1.1 → 令和6年1月1日)、曜日付き日付、時刻とアスペクト比の区別、分数表記など、細かなパターンにも対応しています。
今後もうまく読み上げできないパターンを見つけ次第、継続的に改善していく予定です。


【内蔵辞書による読み・アクセント精度の改善】

Aivis Cloud API / AivisSpeech には、日本語テキストを正しく読み上げるための内蔵辞書が搭載されています。

新語・ネットスラング・アニメや漫画の作品名・インターネット用語・医療用語・人名・四字熟語・会社名・団体名・固有名詞など、幅広いジャンルの語彙を網羅しています。
特にニュース記事や時事ネタ、技術文書の読み上げにおいて高い効果を発揮します。大規模データを活用しつつも、日々手動で新語への対応や語彙の拡充に取り組んでいます。


📕 なぜ辞書が必要なのか

人名や地名、慣用句をはじめ、日本語の固有名詞の読み・アクセントの推定は、世界的に見ても極めて難しい部類に入ります。
英語であれば、知らない単語でも、スペルからある程度の発音が推測できます。しかし日本語の漢字は、同じ文字でも複数の読み方が存在します。
「向井理」は「むかいおさむ」、「新田真剣佑」は「あらたまっけんゆう」と読みますが、これは辞書(事前知識)なしには推測できません。

最近主流の LLM ベースの音声合成技術では、読みの推定を LLM 自身が行います。そのため、学習データに含まれていない固有名詞や、複数の読み方がある人名を正確に読み上げることが構造的に困難です。
モデルによっては、読み上げるたびに異なる読み方になる「生成ガチャ」が発生することもあります。

Aivis Project では、これらの推定タスクに形態素解析ベースのアプローチを採用しています。地道な手法ではありますが、辞書に登録された単語は常に安定した読みで読み上げられます。
そして辞書を改善していけば、その分だけ着実に精度が向上していきます。


📝 同形異音語とアクセントの問題

日本語には、同じ表記で異なる読み方をする「同形異音語」が非常に多く存在します。
「明日」は「あした」なのか「あす」なのか、
「市場」は「しじょう」なのか「いちば」なのか、
「生物」は「せいぶつ」なのか「なまもの」なのか。
文脈によって読み方が変わるこうした単語を正しく読み分けることは、日本語音声合成における大きな課題です。

さらに、アクセント位置の問題もあります。
『橋が(は↗︎し↘︎が)』・『箸が(は↘︎しが)』・『端が(は↗︎しが)』は、同じ「はしが」でもアクセントが異なります。
また、単語が結合するとアクセントが変化する「アクセント結合」も存在します。「東京都」(と↗︎うきょ↘︎うと)と「東京都知事」(と↗︎うきょうとち↘︎じ)では、アクセントの位置が異なります。

これらは日本語音声合成における最大の鬼門であり、正直なところ、現時点では完全に解決できているわけではありません。


⏱️ 継続的な改善

「正しく読める」ことは、当たり前のように感じられるかもしれません。
しかし、AI エージェントや音声アシスタントなど、音声合成を実務で活用する場面では、読み間違いひとつでイメージや信頼を損なうこともあります。 だからこそ、目立たず地味ながらも極めて重要なこの分野に、地道に取り組んでいます。

現状、すべての固有名詞や新語を完璧に読み上げられるわけではなく、まだまだ改善の余地があることは認識しております。
今後とも大規模データを活用した辞書の拡充や、読み・アクセント推定ロジックの改善を継続的に進めてまいります。

2025年2月時点の情報ですが、以前開発メンバーが制作したスライドにて、読み・アクセント推定の技術について詳しく解説しています。ご興味のある方はぜひご覧ください。

私たちが内蔵辞書を改善するたびに、読み・アクセントの精度が向上していきます。 更新された内蔵辞書は、API をご利用いただいているだけで自動的に反映されます。
また、もし読み間違いを発見された場合は、ぜひ お問い合わせフォーム よりご連絡ください!
確認でき次第、内蔵辞書への反映・修正を検討いたします。

■ 技術的背景 ― なぜ速いのか

Aivis Cloud API の内部では、大量の音声合成リクエストを GPU サーバー上で高速に捌くため、フルスクラッチで新規開発した音声合成 API 基盤「Citoras」を活用しています。

AivisSpeech Engine は一般的な PC 上で 1 人で使うことを想定し、CPU でも高速に動作するよう ONNX Runtime ベースで開発されています。
しかし、GPU サーバー上での生成速度やスケーラビリティには根本的なボトルネックがあり、多くのリクエストを高速に捌く API サーバー用途には最適化されていません。

Citoras は、GPU サーバーでのスケーラビリティと低遅延を徹底的に追求し、ゼロから設計・開発した音声合成 API 基盤です。
単一モデルの推論だけでなく、数百に及ぶ大量のモデルを需要に応じて動的に切り替えながら、常に高スループットで捌き続けること。
ストリーミング配信と 音声コーデックへのエンコードを、音声生成と同時並行で処理すること。
そして、これらを安定して運用し続けることに重点を置いて開発しました。
音声の生成品質は AivisSpeech と同等のまま、以下のような特長を備えています。

  • GPU VRAM・CPU RAM・SSD の 3 階層メモリ戦略と LRU での最適化により、VRAM 容量を超える大量の音声合成モデルを 1 台の GPU サーバーで運用可能です。

  • 利用頻度の高いモデルは自動的に VRAM に配置され、高速な推論を実現します。

  • S3 互換ストレージ (Cloudflare R2 推奨) へのモデル配置に対応し、セキュアでスケーラブルなモデル管理が可能です。

  • 日々増え続ける新語を正しく読み上げられるよう、AivisSpeech Engine / Citoras 向けに、随時内蔵辞書の品質を改良しています。
    新しい内蔵辞書が公開され次第、サーバーを再起動することなく自動更新する機能を搭載しています。内蔵辞書の更新は、すべての音声合成リクエストに即座に反映されます。

  • 複数の API キーによるアクセス制御、サーバー負荷・統計情報の監視 API を完備します。


Aivis Cloud API は、この Citoras を、弊社でマネージドサービスとして提供するものです。音声合成 API やユーザー辞書 API のインターフェイス仕様は、Citoras と完全に互換性があります。
将来的にオンプレミス環境への移行が必要になった場合にも、API の呼び出し部分を変更することなく、スムーズに移行できます。

また、Aivis Cloud API は GPU サーバーを含め全て日本国内リージョンのサーバーで運用しており、国内からのアクセスにおけるネットワーク遅延の最小化にも取り組んでいます。

■ 料金プラン (2026/02/01〜)

【従量課金プラン】

1 万文字あたり 440 円(税込)となります。
使った分だけお支払いいただくシンプルなプランです。

課金は音声合成 API にのみ発生します。/v1/tts/synthesize 以外の API エンドポイントは、現在はすべて無料でご利用いただけます。
大口の利用が見込まれる法人様には、ディスカウントや請求書払いなども検討いたします。

【Aivis プレミアム(月額定額プラン)】

月額 1,980 円(税込)となります。
1 分間に 10 リクエストまでのレート制限内であれば、月間の文字数制限なく音声合成 API をご利用いただけます。
従量課金だと利用を躊躇してしまう方でも、予算の青天井に怯えることなく、安心して音声合成 API を活用いただけます。

さらに、API キーごとに従量課金と定額課金を自由に切り替えられます。
いつでも解約可能です。

Aivis プレミアムは、個人開発や小規模なアプリケーション開発を想定したプランです。
複数のユーザーが同時に音声合成を利用するアプリケーションや、高頻度な API 利用が必要な場合は、従量課金に設定した API キーをご利用ください。
また、サービスの利用状況によっては、予告なくレート制限が変更される場合があります。

なお、Aivis プレミアムでは今後、AivisSpeech Web などのサブスクリプション加入者向けの特典サービスを順次拡充予定です。ぜひご期待ください。

【無料クレジットの配布】

正式リリースに併せて、新規登録を含めた全アカウントに 500 クレジット(500 円相当、約 11,000 文字分)を付与いたします。
高品質な音声生成と応答速度を、まずはぜひ無料でお試しください。

■ ご利用方法

Aivis Cloud API の音声合成 API では、AivisHub で公開されているモデル、またはご自身でアップロードしたプライベートモデルを利用して音声を生成できます。

1. ログインページ から、Google アカウント or メールアドレスでログインします。まだアカウントをお持ちでない場合は、新規登録をお願いします。

2. Cloud API ダッシュボード にて、新しい API キーを作成します。
API キーは、作成時に「従量課金の API キー」にするか、「Aivis プレミアムのサブスク利用の API キー」にするかを選択できます(後者は Aivis プレミアム契約時のみ有効)。
「従量課金の API キー」に設定されている API キーでは、入力文字数ごとにクレジットが消費されます。クレジットが 0 になると音声合成 API も利用できなくなるため、あらかじめご注意ください。

3. API ドキュメントSwagger UIリアルタイム音声合成デモ のソースコードを参照して、音声合成 API のフロントエンドを実装してください。
AIAvaterKit など、すでに Aivis Cloud API に対応くださっている OSS ライブラリやソフトウェアもあります。これらのソフト/ライブラリでは、作成した API キーを設定するだけで、すぐに音声合成 API を試せます。

■ オンプレミス環境でのご利用について

Aivis Cloud API のバックエンド基盤となっている音声合成 API サーバー「Citoras」は、オンプレミス環境や自社管理クラウド(Azure など)への提供にも対応予定です。
『社内の GPU サーバーで運用したい』『データを外部に出さず、完全に自社環境内で完結させたい』といったご要望にお応えできます。
製品は Docker イメージとして提供されるため、OS やライブラリの依存関係に悩まされることなく、開発から本番まで一貫した環境で、迅速かつ確実なデプロイが可能です。

前述の通り、Citoras の音声合成 API とユーザー辞書 API は、Aivis Cloud API と完全に互換性があります。
まずは Aivis Cloud API で PoC(概念実証)や小規模テストを行い、その後オンプレミス環境へ本格展開する、段階的かつ柔軟な導入戦略が可能です。

導入に向けた事前のご相談も承っておりますので、ご興味のある法人様は、ぜひ お問い合わせフォーム よりご連絡ください。

■ オフィシャルモデルのご紹介

このたび、総プレイヤー数15万人を超える AI キャラチャットゲーム『オズチャット -Oz Chat-』(開発・運営: 株式会社Trippy)との公式コラボレーションにより、「コハク」「まお」の2種類の音声合成モデルを、オフィシャルモデルとして公開しております。

本モデルは、CV を担当されている声優・ねゆたろ (@___neyu_zzz) さんの声をもとに Trippy 社が制作した、同作で人気のキャラクター「猫音コハク」「卯畑まお」の音声合成モデルです。
各モデルには複数のスタイルを搭載し、ナレーションからキャラクターボイスまで幅広くご活用いただけます。
ACML-1.0 ライセンスのもと、商用利用も含め自由にご利用いただけます。

■ 開発体制について

Aivis Project は、小規模なチームで開発・運営しております。
今後も日本語音声合成に特化した研究開発・製品リリースを進めつつ、国内サーバーでの API 運用、日本語でのサポート対応、請求書払いへの対応など、ローカルならではの価値を提供できるよう努めてまいります。

小規模ゆえに至らない点もあるかもしれませんが、Aivis プレミアムへのご加入は、サーバー運用や機能開発を継続していく上での支えになります。
もしご興味をお持ちいただけましたら、ぜひ応援いただけますと幸いです。

■ お問い合わせ

Aivis Cloud API に関するご質問、導入のご相談、その他お問い合わせは以下のお問い合わせフォームよりお願いいたします。

■ 関連リンク

  • Cloud API ダッシュボード:
    API キーの発行・管理、クレジット残高のチャージ・確認、サブスクリプションの管理・アナリティクスの表示などが行えます。

  • リアルタイム音声合成デモ:
    Aivis Cloud API のストリーミング音声合成をリアルタイムで体験できるデモページです。
    ソースコードはデモページの HTML にすべて含まれていますので、ぜひ実装の参考としてご活用ください。(ライセンスはパブリックドメインとします。)

  • API ドキュメント (ReDoc):
    Aivis Cloud API の詳細な仕様ドキュメントです。API の詳細を把握したい方におすすめです。
    API ドキュメントは、API への機能追加や仕様変更を行った際に随時自動で更新しています。

  • API Playground (Swagger UI):
    インタラクティブな API ドキュメントです。ブラウザ上で直接 API をお試しいただけます。

  • AivisSpeech の裏側の技術を探る:
    以前開発メンバーが制作したスライドにて、読み・アクセント推定の技術について詳しく解説しています(2025年2月時点の情報です)。


いいなと思ったら応援しよう!