---
title: "無料のオーディオからテキストへのコンバーター: プライベート、アップロードなし | Yaps"
description: "ブラウザ上で動作する無料の音声からテキストへのコンバーター。アップロードもサインアップも長さの制限もありません。 MP3、WAV、M4A、またはビデオを転写し、TXT または SRT をエクスポートします。"
canonical: "https://www.yaps.ai/ja/%E3%83%84%E3%83%BC%E3%83%AB/%E9%9F%B3%E5%A3%B0%E6%96%87%E5%AD%97%E8%B5%B7%E3%81%93%E3%81%97"
language: "ja-JP"
---

[無料ツール](/ja/ツール)Yaps によって

# 音声をテキストに変換、 upload.

MP3、WAV、M4A、またはビデオ ファイルをドロップすると、テキストが返されます。長さ制限やアカウントはなく、録音がコンピューターから離れることはありません。プレーンテキスト、タイムスタンプ付きテキスト、または .srt ファイルをエクスポートします。

お使いのマシン上で実行可能 · アップロードなし · 長さの制限なし

モデル

transcription を起動中

オーディオまたはビデオ ファイルをドロップする

MP3、WAV、M4A、MP4、MOV — 任意の長さ

## このツールについて

## この無料で正確な音声からテキストへのコンバーターの仕組み

ファイルをページにドロップすると、3 つのことが順番に起こります。ブラウザはオーディオ トラックを生のサウンドにデコードします。音声モデルは一度ダウンロードされてキャッシュされるため、文字起こしする 2 番目のファイルではその待機がスキップされます。次に、モデルは、独自のプロセッサまたはグラフィックス カードを使用して、マシン上でオーディオを読み取り、テキストを書き込みます。

2 つのモデルからお選びいただけます。高速なものは英語のみで約 44 MB です。これは、主にテキストをすぐに読みたい場合のボイスメモ、一人のポッドキャスト、または英語の講義に最適です。バランスの取れたものは多言語対応で約 80MB です。ダウンロードと実行に時間がかかりますが、アクセントや静かな録音、英語以外の音声にはよく耐えます。

WebGPU を搭載したマシンは、リアルタイムよりも数倍高速に実行されます。古いブラウザは、まだ動作する遅いパスに戻りますが、時間がかかるだけです。どちらの場合でも、作業はローカルで行われるため、ファイルに関する情報はどこにも送信されません。

## どのオーディオおよびビデオ形式を転写できますか?

MP3、WAV、M4A、FLAC、OGG はすべて機能し、ほとんどの MP4 および MOV ビデオのオーディオ トラックも機能します。このツールは音声を読み取り、画像を無視するため、画面録画、Zoom エクスポート、または電話で撮影したビデオをドロップインしても問題ありません。

フォーマットのサポートは、当社が管理するリストではなく、ブラウザー独自のオーディオ デコーダから提供されます。つまり、ほとんどのものが機能しますが、いくつかの特殊なコーデックは機能しません。ファイルが拒否された場合は、任意のエディタまたは QuickTime で MP3 または WAV としてエクスポートすると問題は解決します。

ファイルサイズよりも長さがはるかに重要です。 10 分間のトークの大きなロスレス WAV は、2 時間のパネルの小さな MP3 よりずっと前に終了します。これは、モデルがメガバイトではなく読み取り時間を考慮しているためです。高度に圧縮された録音、つまりチャット アプリを通過させた後に薄く空虚に聞こえる種類の録音は、間違いが増えるため、元のファイルが残っている場合はそれを使用してください。

## 長さ制限なしで長い音声を文字起こしする

このカテゴリのほとんどの無料ツールは、何らかの制限があります。最初のファイルは 10 分、1 日に 3 つのファイルは各 30 分、毎月の分単位の割り当て、または無料枠 (実際には最後にカードが付いているお試し版) があります。これらの上限が存在するのは、録音がサーバーにアップロードされ、誰かが処理時間に対して料金を支払わなければならないためです。

ここには何もアップロードされないため、上限を設ける費用は発生しません。 3 時間のインタビューは、30 秒の音声メモと同じように扱われます。 1 日あたりの割り当て、キュー、上限に達するアカウントはありません。

本当の限界はあなたの忍耐力とハードウェアです。ファイルが長いと、ブラウザーのタブがしばらくビジー状態になり、そのタブを開いたままにする必要があるため、ラップトップを数分間放置できるときに 2 時間の記録を開始します。ブラウザーはバックグラウンドで実行されるタブの速度を低下させるため、可能であればタブをフォアグラウンドに保ちます。

## サーバーにアップロードせずに音声を文字起こしする

アップロード禁止はここでの構造的な事実であり、信頼して受け入れていただくようお願いしているポリシーではありません。モデル ファイルがブラウザにダウンロードされると、その時点からオーディオ、モデル、完成したテキストがすべてコンピューター上の同じタブに表示されます。

自分で確認できます。ページをロードし、モデルのダウンロードが完了するまで待ち、Wi-Fi をオフにして、ファイルをドロップします。それはまだ転写されています。

これが最も重要になるのは、録音したものが実際に自分のものではない場合です。クライアントからの電話、患者との会話、人事会議、同意書でカバーされた調査インタビュー、禁輸下の未公開資料。これらのいずれかを無料の Web ツールにアップロードすると、それらは他の人のインフラストラクチャおよび他の人の保持ポリシーに移動されます。

これによってツールが特定の規制に準拠するとは主張しません。それは、組織とその後のトランスクリプトの処理に依存するためです。はっきり言えるのは、このページではあなたの録音はまったく送信されないということです。

## プレーンテキスト、タイムスタンプ付きテキスト、または SRT ファイルをエクスポートする

1 回の実行で 3 つのエクスポートが行われます。

プレーン テキストは、連続した散文としてのトランスクリプトであり、文書、電子メール、またはメモにすぐに貼り付けることができます。ほとんどの人が面接や講義に求めるのはこれです。

タイムスタンプ付きのテキストには、各行にタイム マーカーが付けられます。引用文を取り出したり、テープと照らし合わせて主張を確認したり、チャプターマークを付けてショーノートを書いたりするなど、何かが言われた瞬間を見つける必要がある場合に使用します。

SRT は、ビデオ編集者、YouTube、Vimeo、およびほとんどのプレーヤーが読み取る字幕形式です。ファイルをビデオの横にドロップすると、キャプションがスピーチに合わせて表示されます。

3 つのいずれかをクリップボードにコピーするか、ファイルとしてダウンロードできます。次の訪問の間には何も保存されないため、タブを閉じる前に必要なものを保存してください。字幕が唯一の目的である場合は、字幕ジェネレーターが同じエンジンを実行し、代わりにキューのタイミングと行の長さに基づいて構築されたワークフローを使用します。

## できないこと: 話者を区別すること

誰が話しているのかを特定することはできません。 2 人によるインタビューは、ラベルのない 1 つの連続したテキスト ブロックとして返されます。これは、この無料ツールが実際には実行しないことの 1 つであり、録音して 1 時間も経ってからわかるようになるよりも、ここでそう言っておきたいと思います。

理由は重さです。録音を音声ごとに分割するには、音声のすべてのセグメントを他のすべてのセグメントと比較して、文字起こしと並行して実行する 2 番目のモデルが必要です。すでに音声モデルをダウンロードしている Web ページにそれを求めるのは多すぎます。間違った名前が付けられたトランスクリプトは、名前がまったくないトランスクリプトよりも修正に時間がかかるため、下手に行うことは、行わないよりも悪いです。

誰が録音の要点を言ったのかというと、Yaps デスクトップ アプリは、同じアップロードなしのアプローチで、自分のマシン上で会議やインタビューの発言者ラベル付きトランスクリプトを作成します。講演者が 1 人の場合、必要なのはこのページだけです。

## インタビュー、講義、ポッドキャスト、ボイスメモの文字起こし

ジャーナリストはこれをインタビューテープに使用しますが、これはまさに無料の Web サービスに渡すべきではない資料です。学生は録音された講義を文字に起こし、テキスト内で試験の実際の内容を検索します。ポッドキャスターは、編集者に送信される前に、エピソードから番組メモや引用を取り出します。研究者らは、音声は承認されたデバイスに保存されるという倫理承認に違反することなく、フィールド録音を実行しています。

サポート チームとセールス チームは、通話の録音を文字に起こして、次々と出てくるフレーズを見つけます。ライターは歩きながらの音声メモを大まかな初稿に変えます。アクセシビリティ チームは、これまで存在しなかったビデオの代替テキストを作成します。

共通するのは、既に存在するファイルと、そこから取り出される必要があるテキストです。代わりに、目の前で開いているアプリにライブで話したり、書き込んだりしたい場合、それは文字起こしではなくディクテーションであり、形状が異なる別のツールです。

## ブラウザで音声をテキストに使用する方法

1. ### モデルを選択してください

英語を素早く録音するには高速英語専用モデルを、アクセントや静かな音声、その他の言語にはバランスの取れた多言語モデルを選択してください。モデルは一度ダウンロードされると、ブラウザーにキャッシュされます。
2. ### オーディオまたはビデオ ファイルを追加します

MP3、WAV、M4A、FLAC、OGG、MP4、または MOV ファイルをドロップ ゾーンにドラッグするか、クリックして参照します。ファイルはブラウザで読み取られ、アップロードされません。
3. ### 転写されるまで待ちます

このページは音声を読み取り、モデルをロードしてから文字起こしします。録音が長いほど時間がかかります。ブラウザの動作が遅くならないように、タブを開いてフォアグラウンドに保ちます。
4. ### トランスクリプトを読んで確認する

単純な散文ビューとタイムスタンプ付きビューを切り替えます。名前、地名、専門用語をざっと読み取ってください。これらは音声モデルが最も間違えやすい単語です。
5. ### テキストをコピーまたはダウンロードする

トランスクリプトをクリップボードにコピーするか、プレーン テキスト、タイムスタンプ付きテキスト、または .srt 字幕ファイルとしてダウンロードします。タブを閉じた後は何も保持されないため、終了する前に保存してください。

## 質問

**この音声からテキストへのコンバーターは本当に無料ですか?**

はい、お試しという意味ではなく、通常の意味で無料です。分単位の割り当て、1 日あたりのファイル制限、カードはありません。トランスクリプションは独自のプロセッサ上で実行されるため、何度でも実行しても費用はかかりません。私たちはこのページからではなく、Yaps デスクトップ アプリと Android アプリから収益を上げています。

**サインアップまたはアカウントを作成する必要がありますか?**

いいえ。結果の前にアカウント、電子メール ボックス、ログインの壁はありません。ページを開いてファイルをドロップし、テキストを取得します。

**録音できる長さに制限はありますか?**

長さのキャップはまったくありません。 3 時間の録音は 3 分間の録音とまったく同じように機能しますが、完了までに時間がかかるだけです。ブラウザーはバックグラウンドでのタブの速度を低下させるため、実行中はタブを開いてフォアグラウンドで維持してください。

**私の音声はどこかにアップロードされますか?**

いいえ。音声モデルはブラウザに一度ダウンロードされ、その後は音声とトランスクリプトがマシン上のそのタブに残ります。モデルがロードされ、ツールがまだ文字起こしを行ったら、インターネットから切断します。

**どのオーディオ ファイルとビデオ ファイルを受け入れますか?**

MP3、WAV、M4A、FLAC、OGG に加え、ほとんどの MP4 および MOV ビデオのオーディオ トラック。ブラウザで特定のファイルを開けない場合は、まずそのファイルを MP3 としてエクスポートすると常に機能します。

**誰が話しているのか教えてもらえますか？**

いいえ。話者識別には、Web ページ上で実行するには重すぎる 2 番目のモデルが必要です。そのため、複数人の録音は 1 つのテキスト ブロックとして返されます。 Yaps デスクトップ アプリは、インタビューや会議の発言者ラベル付きトランスクリプトを作成します。

**対応言語は何ですか?**

バランスの取れたモデルは多言語に対応しており、幅広い言語をカバーしていますが、精度は言語や録音のきれいさによって異なります。高速モデルは英語のみです。英語以外のものについては、バランスの取れたものを選択してください。

**どのくらい正確ですか?**

正直な答えはオーディオによって異なるため、精度のパーセンテージは引用しません。マイクに近い1つのクリアスピーカーは非常に良く聞こえます。クロストーク、背景ノイズ、激しい圧縮、騒がしい部屋での強いアクセントはすべてエラーを増大させます。最後まで読んで、名前や専門用語を修正してください。

**タイムスタンプや字幕を取得できますか?**

はい。実行するたびに、プレーン テキスト、タイムスタンプ付きテキスト、および .srt 字幕ファイルが生成され、それらのいずれかをコピーまたはダウンロードできます。字幕だけが必要な場合は、無料の字幕ジェネレーターがその用途に合わせて構築されています。

**電話でも機能しますか?**

モバイル ブラウザでも実行できますが、携帯電話ではメモリが少なく、長いファイルでは非常に時間がかかるため、インタビューを文字に起こすにはラップトップまたはデスクトップの方が適しています。 Yaps Android アプリは、ファイルの文字起こしではなく、携帯電話での音声入力用です。

**1 時間の音声にはどのくらい時間がかかりますか?**

WebGPU を搭載した最近のラップトップでは、文字起こしがリアルタイムよりも数倍速く実行されるため、通常は数分かかります。古いマシンはより遅いパスに戻り、かなり長い時間がかかります。 1 回限りのモデルのダウンロードは、最初の実行時にのみ行われます。

**タブを閉じるとトランスクリプトはどうなりますか?**

なくなってしまいました。次の訪問の間は何も保存されないため、ページを離れる前にテキストをコピーまたはダウンロードしてください。トランスクリプト履歴をデバイス上に残しておきたい場合は、デスクトップ アプリが最適です。

## その他の無料ツール

[字幕ジェネレータービデオを時間指定された .srt または .vtt ファイルに変換します。](/ja/ツール/字幕生成) [音声をテキストに変換ブラウザ上で話して、それがテキストになるのを見てください。](/ja/ツール/音声テキスト変換) [フィラーワードカウンター](/ja/ツール/フィラーワードカウンター) [すべて無料のツールすべての Yaps ブラウザ ツールはすべて自分のマシン上で実行されます。](/ja/ツール)

わめき始めるMac · Windows · Linux · Android

## 今すぐ調べてください 誰が何を言ったのか.

インタビューや会議の発言者ラベル付きトランスクリプト。

[Mac 用ダウンロード](https://github.com/richawo/yaps-releases/releases/latest)

macOS 13.0 以降が必要 (Apple Silicon を推奨)iOSは近日公開予定
