2系統の同時録音
システム音声とマイクを同時に取り込み、自動でミックス。オンライン会議、講義、インタビュー、対面の打ち合わせまで、どちらの声も漏らしません。
システム音声とマイクを同時に録音し、話した瞬間に文字になります。13言語へリアルタイム翻訳、AI議事録もワンクリック。 主要機能はすべてあなたのPC上で動作します —— ローカルは永久無料・オープンソース。もっと高い精度が必要なときは、クラウドの優良モデルを必要な分だけ選べます。
新規登録で 100 クレジット進呈(完全な会議 約3時間分)
1回の録音から、文字起こし・翻訳・字幕・議事録まで。しかもすべて自分のPC上で完結します。
システム音声とマイクを同時に取り込み、自動でミックス。オンライン会議、講義、インタビュー、対面の打ち合わせまで、どちらの声も漏らしません。
X-ASR と SenseVoice の2つのローカルエンジンがストリーミング認識。話しながら文字が出て、すべてオフラインで動きます。
文単位のパイプラインで13言語へ翻訳。訳文は原文のすぐ下に並ぶので、会議をしながら読めます。
ローカルLLMがトピック・結論・アクションアイテムをオフラインで生成。自分のAPIをつなぐこともできます。
常に最前面に浮かぶ独立した字幕ウィンドウ。ドラッグで移動でき、行数と文字サイズも調整可能。外国語の会議が字幕付きの映画のように見られます。
原文も訳文もワンクリックで読み上げ。31言語に対応し、音声も選べます。
すべての会議はローカルのSQLiteに保存。全文検索、その場での編集、別モデルでの再認識ができます。
TXT / SRT / Markdown / 議事録をワンクリックで書き出し。PDFへの印刷もでき、そのまま保管できます。
クラウドの優良モデルをアプリに統合し、字幕をデスクトップに浮かべ、無料と有料をはっきり分けました。
数GBのモデルを待つ必要はもうありません。クラウドの大規模モデルを直接呼び出し、より高精度な多言語認識、より正確なリアルタイム翻訳、より大きな要約モデルを利用できます。同じ会議を別モデルで再認識して比較することもできます。
常に最前面に表示される独立した字幕オーバーレイ。好きな位置に動かせ、行数と文字サイズも設定できます。会議・配信・講義の上に、リアルタイム字幕が浮かびます。
ローカルモデルは永久無料で、時間制限も回数制限もありません。クレジットを消費するのは、自分でクラウドモデルを選んだときだけ。実際の使用量に応じた課金で、サブスクも月額も自動更新もありません。購入したクレジットに有効期限はありません。
1つのアプリに2つのエンジン。普段の会議はローカル、精度や多言語が必要なときはクラウド。いつでも切り替えられます。
| ローカルモデル | クラウドモデル | |
|---|---|---|
| 費用 | 永久無料、時間も回数も無制限 | 実際の使用量に応じてクレジットを消費 |
| ネットワーク | モデルをダウンロードすれば完全オフライン | 接続が必要(多くの地域から直結可能) |
| プライバシー | 音声もテキストもPCの外に出ない | 選んだ内容だけがサーバーへ送信される |
| 準備 | 初回のみ 0.5〜2.5 GB のモデルをダウンロード | ダウンロード不要、選んですぐ使える |
| 向いている用途 | 日常の会議、機密性の高い用途、オフライン環境 | 多言語会議、長時間会議、最高精度を求める場合 |
クレジットを消費するのはクラウドモデルを使ったときだけ —— 音声認識・リアルタイム翻訳・議事録・読み上げが同じ残高を共有します。お支払い後はコードが自動発行され、アプリの「アカウント → チャージ/引き換え」で貼り付けるだけで反映されます。
まずはクラウドモデルを試したい方に
長時間・多言語の会議に
1クレジットあたり最安
完全な会議(認識+翻訳+要約)約3時間分に相当します。初回限定・数量限定。進呈分の有効期限は受け取り日から90日です。
時間は「1時間の会議で音声認識+リアルタイム翻訳+議事録」という一般的な構成で試算したものです。実際の消費量は選択したモデルによって変わります。
コマンドラインも環境構築も不要。インストールして、ウィザードに従うだけです。
GitHub Releases からお使いのプラットフォームのインストーラー(約50 MB)をダウンロードして実行します。初回起動時のセキュリティ警告は下のよくある質問をご覧ください。
初回起動のウィザードがローカルモデルのダウンロードまたはインポートを案内します(中国本土では自動的にミラーへ切り替え)。クラウドモデルを選べばダウンロードを丸ごと省略できます。
マイクとシステム音声を選んで録音ボタンを押すだけ。文字がリアルタイムで表示され、翻訳・デスクトップ字幕・読み上げもいつでも有効にできます。
終了後にワンクリックでAI議事録を生成。履歴から全文検索・編集・再認識ができ、TXT / SRT / Markdown / PDF に書き出せます。
主要機能は完全に無料で、オープンソース(AGPL-3.0)です。ローカルの文字起こし・翻訳・議事録・デスクトップ字幕は時間制限も回数制限もなく、アカウント登録も不要です。
クレジットを消費するのは、自分でクラウドモデルを選んだときだけ。実際の使用量に応じた課金で、サブスク・月額・自動更新はありません。新規登録では 100 クレジットを進呈します。
ローカルモデルの場合、モデルのダウンロードが終われば完全にオフラインで動作します。音声・文字起こし・翻訳・要約はすべてお使いのPC上で処理され、デバイスの外には出ません。
サーバーに送信されるのは、自分でクラウドモデルを選んだときの該当部分だけです。ローカル機能には影響しません。
不要です。すべてのモデルは量子化版で、CPUだけで動作します(8スレッド以上を推奨)。ローカルのリアルタイム文字起こしは RTF ≈ 0.25、ローカルのリアルタイム翻訳は1文あたり約2〜4秒です。
Windows 10 / 11 と macOS(Apple シリコン版)に正式対応しています(インストーラーは約50 MB)。Linux は計画中です。GitHub Issues での投票が優先順位の参考になります。
特定のアプリに依存せず、システムレベルで音声を取得します。Zoom、Teams、Google Meet、Feishu、ウェビナー、講義、配信、ポッドキャストのいずれでも使えますし、会議室にノートPCを持ち込んで対面の打ち合わせを録音することもできます。
インストーラーはまだコード署名を取得していないため、一度だけ警告が出ます —— ソフトウェアに問題があるわけではありません。ソースは完全公開されており、README に従って自分でビルドすることもできます。
Windows:SmartScreen の青い警告が出たら「詳細情報 → 実行」を選んでください。
macOS:「開発元を確認できません」と表示されたら、アプリを右クリックして「開く」を選ぶか、「システム設定 → プライバシーとセキュリティ」で許可してください。
Doubao(豆包)、Qwen(千問)、MiMo、Deepgram などに対応し、30以上の言語をカバーしています。中国語なら Doubao、英語や海外向けなら Deepgram、多言語が混ざる会議なら Qwen が有力です。
同じ会議を別のモデルで再認識して結果を比べ、良い方を選べます。
「1時間の会議で認識+翻訳+要約」という一般的な構成で約34クレジットなので、100 クレジットはおよそ3時間分の完全な会議に相当します。ファイルの文字起こしだけであれば、もっと長く使えます。
実際の消費量は選んだモデルによります。アプリの「アカウント」で日付・モデルごとに明細を確認できます。
このページでクレジットを購入すると、支払い完了後に引き換えコードが自動で表示されます。VoxMinutes を開き「アカウント → チャージ/引き換え」にコードを貼り付けると、すぐに反映されます。
残高はアカウントに紐づくので、PCの買い替えや再インストールでも消えません。購入したクレジットに有効期限はありません。
無料ダウンロード。ローカルモデルはウィザードが取得し、中国本土では自動的にミラーへ切り替わります。プロキシは不要です。
macOS で初回起動時に「開発元を確認できません」と表示されたら、アプリを右クリックして「開く」を選ぶか、「システム設定 → プライバシーとセキュリティ」で許可してください。