1 周年

$52M シード調達

8M+ クリエイター

私たちのストーリー
S2.1 Pro:開発者向けに完全無料で利用可能に

プロダクショングレードの音声 AIスタートアップ価格でコミュニティのように開かれた存在へ

リアルな音声合成、ボイスクローニング、文字起こしを、たったひとつのAPIで。公式 Python / TypeScript SDK に対応し、1秒未満(サブ秒)の低レイテンシを実現。初期費用なしで1回目のリクエストから完全従量課金でご利用いただけます。

HeyGen や Plaud 等の有力プロダクトを裏で支える最高峰モデル。初回利用から完全従量課金。本番価格(プロダクションレート)の確認に「お問い合わせ」は不要です。

商用プロダクトで音声機能を展開する企業に選ばれています

音声エージェント・会話型 AI
動画ナレーション・吹き替え・音楽
インタラクティブ・ソーシャル
教育・学習コンテンツ

サインアップから最初の音声まで 5 数分で

商談不要。APIキーを取得してSDKをインストールし、すぐにリリースできます。

CURL · テキスト読み上げ
# Text to speech in one call
curl -X POST \ https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro-free" \
-d '{"text": "Hello! Welcome to Fish Audio."}' \
--output welcome.mp3
PYTHON SDK
# Text to speech with the Python SDK
from fish_audio_sdk import Session, TTSRequest
 
session = Session("YOUR_API_KEY")
request = TTSRequest(text="Hello! Welcome to Fish Audio.")
with open("welcome.mp3", "wb") as f:
for chunk in session.tts(request):
f.write(chunk)

Fish 上でチームが実装するもの

カメラ映えする音声

# アバター動画

AIアバター製品に特化した、リップシンク対応・感情豊かなTTS。ただテキストを読み上げるだけでなく、インラインの演出タグによって、まるで感情の宿った「演技」を可能にします。

HeyGen
VIGGLE
Pictoria

リアルタイム会話 AI

# 音声エージェント

WebSocketによる1秒未満の超低遅延なターン制御。ストリーミング対応のTTSとASRを単一スタックに統合し、ユーザーによる発話の割り込み検知にも標準対応しています。

Retell
Sanas
Dubbing AI

リアルタイムに生成される音声コンテンツ

# 音声コンテンツ & AIコンパニオン

ノートの音声化、学習・教材ツール、そしてAI対話パートナー。 アカウント(席)数による固定費ではなく、利用した文字数に応じて柔軟に変動する「従量課金システム」を採用しています。

PLAUD
Final Round AI

30秒でスピード生成。クローン不要の即時導入も。

# キャラクターアプリ

わずか30秒の音声から手軽に作成できるIVC。スタジオクオリティの完全な再現(レプリカ)にはPVCを。また、豊富なボイスライブラリからお好みの声を選べば、クローニング不要で今すぐ導入(リリース)も可能です。

OpenArt

リアルタイムな技術スタックに対応

オープンウェイト(有償の商用ライセンスが必要)

当社のオープンソースモデル(fish-speech、S1、S2)は、有償の商用ライセンス付き「オープンウェイト」として提供しています。本番運用の要件に応じて、自社のVPC、オンプレミス、ソブリンクラウド、あるいは完全に隔離されたエアギャップ環境へのセルフホストが可能です。なお、セルフホストのご利用はEnterpriseプラン(法人向け契約)の対象となります。詳細は下記をご覧ください。

ライセンスの条件を読む

15,000超のディレクションタグ。 テキスト内に書き込むだけで、そのまま呼び出し可能。

[warm], [near-whisper], [reassuring] — 感情や声色の指示はテキストに添えるだけ。別個のパラメータ指定も、選択肢からの選択も不要です。タグを追加・拡張してもスキーマ変更の手間はありません。

ディレクションタグ ライブラリを見る

Audio Turing Test: 0.515.

ブラインドテストにおいて、検証参加者は S2.1 Pro と人間の声をほとんど聞き分けられませんでした。計581件の比較検証を実施。評価手法および実際の音声サンプルを全公開しています。

研究成果を見る

100万文字あたり$15(1回目の利用から適用)

HeyGen や Plaud 等の有力プロダクトを裏で支える最高峰モデル。 初回利用から完全従量課金。本番価格(プロダクションレート)の確認に「お問い合わせ」は不要です。

料金プラン一覧を見る

提供APIを利用するか、モデルをセルフホストして運用する

今すぐ開発を始めるなら、クラウドAPI。 本番運用で高度な要件が求められたら、エンタープライズプランでのセルフホストへ。

クラウドAPI | あらゆるチーム向け

クラウドAPI(従量課金:$15 / 100万文字)。モデルを自社で運用・構築することなく、最短でプロダクション運用を開始できます。

  • WebSocket ストリーミング、REST、Python + TypeScript SDK
  • $15 / 1M UTF-8バイト(契約の縛りなし)
  • API呼び出し時にインラインで指示構文を指定
  • オープンウェイト版と同じモデルを採用

モデルをセルフホストする

当社のオープンソースモデル(fish-speech、S1、S2)は、有償の商用ライセンス付きオープンウェイトとして提供しています。自社のVPC、データセンター、ソブリンクラウド、さらにはエアギャップ(オフライン)環境へ自由にデプロイ可能です。データの保管場所(データレジデンシー)の制限、独自のファインチューニング、厳格な規制への対応が求められる、大規模運用チーム向けのプレミアムなエンタープライズプランです。

  • WebSocket ストリーミング、REST、Python + TypeScript SDK
  • $10k/月
  • 最低導入費用の目安:$120–150K/年
  • 弊社リサーチチームと直接相談が可能

価格設定ビジネスの拡大を邪魔しない

初日から安心の完全従量課金制。アカウントごとの固定費(シート料)や年間契約の縛りは一切ありません。商用利用でも「お問い合わせ」は不要です。

料金プラン一覧を見る
モデル
TTS
TTS
TTS
ASR
モデル名
S2.1 Pro Free
S2.1 Pro
S1
Transcribe-1
料金
開発者は無料
$15 / 1M UTF-8 bytes
$15 / 1M UTF-8 bytes
$0.36 / 時間

よくある 質問

ElevenLabs、Cartesia、Rime からの乗り換えをお考えの方へ

機能、価格、契約条件を徹底比較。互換性の高いAPI(同じリクエスト構造)を採用しているため、本番環境の移行もほとんどが1週間以内に完了します。

比較を見る

ベンチマーク、評価手法、生音声データ

Audio Turing Test の検証結果、ブラインド評価の手法、そしてオープンウェイト・ライセンスについて。―― 本ページに掲載されたすべての実績には、確かなエビデンスがあります。

リサーチレポートを読む
Fish Audio

今週末のスピードリリースを実現

まずは無料クレジットでお試し。カード登録は不要です。 プロトタイプ開発から大規模運用まで、ずっと同じプランで。