生成AIで文字起こし|ツール比較と誤変換を見抜く実務手順

生成AIで文字起こし|ツール比較と誤変換を見抜く実務手順

この記事の監修者

リスキルAIキャリア編集部

リスキルAIキャリア編集部

リスキルAIキャリアは、AI時代の学び直し・キャリア形成・副業・転職に役立つ情報を発信するWebメディアです。編集部では、生成AIスキルの身につけ方、AI関連スクール・講座の選び方、キャリアアップにつながる学習方法などを、実務目線でわかりやすくお届けしています。

生成AIの文字起こしは、録音条件で失敗率が変わります。静かな独話はAIで初稿化できます。

複数話者、同時発話、方言、専門用語、機密情報が混じる音声は、人が工程を握ります。AIは下書きどまりです。

音質・話者数・専門用語・機密度の4軸で仕分けると、任せてよい音声と危険な音声を判断できます。

この記事では、ツール比較、音声の判定表、30分音声の作業時間、誤変換チェック、機密音声の扱いまで具体化します。本記事の更新日は2026年9月11日です。作業時間表と判定表は実測値ではなく、Whisper medium相当とChatGPTの整形を想定した作業設計用の推定値です。実測データとして扱わないでください。

目次

主要ツール別の比較|料金・対応形式・向き不向き

主要ツール別の比較|料金・対応形式・向き不向き

最初に決めるのは「音声をどこへ送るか」です。方式・料金・機密の扱いで使うツールが決まります。

※料金・仕様は変更されます。最終確認は各公式ページで行ってください。以下は公表されている料金体系の代表例で、金額の断定ではありません。為替は1ドル=150円で概算します。

主要文字起こしツールの比較(料金・仕様は各公式ページで最終確認)
ツール 料金・無料枠 1時間音声の概算コスト 日本語対応 音声ファイルアップロード 話者分離 データ利用・保存で確認する公式ページ 向く用途 避ける用途
OpenAI Whisper ローカル版は無料。API版は$0.006/分(公表例) API版は60分で$0.36≒約54円 対応 API・ローカルで対応 標準では非対応 OpenAI PricingWhisper公式GitHub 機密音声のローカル処理、独話の初稿 話者分離が必須の会議
ChatGPT 無料枠あり。有料は月額(公式ヘルプ確認) プラン枠内で処理(追加従量は原則なし) 対応 プラン・画面により可否が変動 非対応 ChatGPTヘルプ 下書きの整形・要約 長時間・機密・厳密議事録の一発生成
Googleドキュメント音声入力 無料 無料(リアルタイム口述のみ) 対応 非対応(マイク入力) 非対応 Googleドキュメント音声入力ヘルプ その場の口述筆記 録音済みファイルの処理
Microsoft Teams 有料プランに付帯(公式確認) 会議内で処理(プラン枠内) 対応 会議録画から 参加者単位で対応 Teams文字起こしヘルプMicrosoft Trust Center 社内会議の議事録 外部音源の単発処理
Zoom 有料プラン中心(公式確認) 会議内で処理(プラン枠内) 対応 クラウド録画から 対応 Zoom文字起こし/クラウド録画ヘルプ オンライン会議 持ち込み音源の処理
Notta 無料枠あり(公表例で月120分程度)。有料は月額課金(公式確認) 有料プランの月内枠で60分を処理 対応 対応 対応 Notta公式料金 会議・インタビュー 学習・保存の確認前の機密音声
CLOVA Note 無料(月あたり利用時間の上限あり・公式確認) 無料枠内で処理 対応 対応 対応 CLOVA Note公式 会議・取材 規約確認前の社外秘
Rimo Voice 従量課金と月額プラン(公式確認) 従量は分数課金(公式料金で確認) 対応(日本語特化) 対応 対応 Rimo Voice公式料金 日本語の会議・インタビュー 規約確認前の機密音声

機密音声はローカル実行のWhisperを使います。社内会議はTeamsやZoomの純正トランスクリプトが管理しやすい構成です。概算コストと機密の列を先に見ると、選定は数分で終わります。

日本語精度の体感差は、独話ではWhisper mediumもRimoも差が小さい一方、雑音・専門用語では日本語特化のRimoやNottaが読みやすい下書きを出しやすい印象です。ここは推定であり、音源で逆転します。最終判断は自社の音源で試写してください。

音声認識AIと生成AIの役割分担|2工程で組む

音声認識AIと生成AIの役割分担|2工程で組む

文字起こしは2工程で構成します。音声認識AIで文字列を作り、生成AIで表記統一や要約を行います。

聞き間違いの確定だけは原音で確認します。役割を分けると、精度が落ちる場所が見えます。

音声認識AI(Whisperなど)が担う工程

音声をテキストへ変換する工程です。OpenAIのWhisperは多言語の音声認識モデルとして公開されています。

精度は音質・話者数・専門用語・方言で変わります。出力は句読点が荒い素の文字列です。仕様はWhisper公式GitHubで確認します。ローカル実行なら音声を外部送信せず処理できます。機密音声で選ばれる理由がここにあります。

生成AI(ChatGPTなど)が担う工程

テキスト化後の校正・整形・要約は生成AIの担当です。ChatGPTは話し言葉を書き言葉へ直す整形に使います。

ただし原音を持たないため、聞き間違いの真偽は判定できません。生成AIは誤変換をもっともらしい別語に上書きします。だから最後の原音照合が要ります。校正の可否は生成AI文章校正の使い方で工程別に整理しています。

ChatGPTで文字起こしする方法|直接アップロード型とWhisper経由型

ChatGPTで文字起こしする方法|直接アップロード型とWhisper経由型

ChatGPTでの文字起こしには2つの経路があります。用途で使い分けます。

直接アップロード型

対応しない画面・プランではWhisper経由に切り替えます。可否はプラン・時期で変わります。手順は次のとおりです。

  1. ChatGPTを開く
  2. ファイル添付ボタンから音声ファイルを選ぶ
  3. 次を入力する:この音声を文字起こししてください。不明箇所は[不明]、推測補完は禁止。話者が変わった可能性がある箇所は改行してください。
  4. 出力後、数字・固有名詞・否定表現を原音照合する
  5. 必要なら議事録形式に再整形する

短い音声の確認や要約に使います。長時間・機密音声・厳密な議事録には使いません。

Whisper経由型

初心者向けに2パターンあります。開発環境の要否で選びます。

  • API/開発環境を使わない:Notta、Rimo、CLOVA Noteでテキスト化 → ChatGPTで整形
  • ローカルWhisperを使う:Python/GitHubが必要、機密音声向け

ローカルWhisperの最小コマンドは次の2行です。

pip install -U openai-whisper
whisper sample.mp3 --language Japanese --model medium

PC性能により処理時間が大きく変わります。会社PCでは管理者権限・セキュリティ規程を確認します。原音とテキストを分けて保持でき、原音照合しやすい構成です。議事録形式の具体プロンプトはChatGPT議事録の作り方にまとめています。

任せていい音声と危険な音声の判定表|4軸の閾値

任せていい音声と危険な音声の判定表|4軸の閾値

音声を音質・話者数・専門用語・機密度の4軸で仕分けます。成否を分けるのはツールより音声そのものです。

4軸で仕分ける文字起こし判定表(青=任せてよい/黄=前処理して任せる/赤=外部AIへ素投入禁止・作業設計用の推定基準)
青信号 黄信号 赤信号
音質 口元30cm以内、空調音・BGMなし 会議室の反響、PC内蔵マイク、軽いタイピング音 飲食店・屋外・電話越し・BGMあり
話者数 1人 2〜3人で発話が重ならない 4人以上、同時発話が頻発
専門用語 一般語中心 1分に1〜2語の業界語 型番・薬剤名・法律名・社内略語が連続
機密度 公開済みセミナー・公開インタビュー 社内共有資料 氏名・顧客名・契約金額・未公開決算・人事評価

判定後の処理ルール

  • 青が4つ:AI文字起こし → 生成AI整形 → 数字・固有名詞だけ照合
  • 黄が1〜2つ:録音改善または用語辞書作成 → AI文字起こし → 全体の30〜50%を重点照合
  • 黄が3つ以上:全文照合前提。納品物には「AI下書き+人手確認」と明記
  • 赤が1つでもある:外部AIへ素投入禁止。ローカルWhisper、社内承認済みツール、匿名化のいずれかを選ぶ

黄信号は用語辞書を先に渡すと初稿精度が上がります。辞書は「表記|読み|意味」で作ります。

用語辞書の例
表記 読み 意味
PEP検定 ピーイーピーけんてい 資格名
与信 よしん 取引先の信用確認
粗利 あらり 売上総利益

赤信号が1つでもある音声は、外部AIにそのまま投入せず、ローカル処理または匿名化してから扱います。

AI文字起こし前提の録音ルール|精度を上げる7項目

精度は録音段階で大きく決まります。「あとでAIが直す」は成り立ちません。

  1. レコーダーを主話者の口元30〜50cmに寄せる
  2. 会議室の空調・プロジェクター・BGMを切る
  3. 冒頭で参加者名を1人ずつ名乗る
  4. 専門用語・社名・製品名を会議前にメモ化する
  5. 同時発話を避け、司会者が発言を区切る
  6. オンライン会議は各参加者に個別マイクを使わせる
  7. 録音前に30秒テスト録音して再生確認する

マイクを話者へ近づけ雑音源を切るだけで、黄信号の音声を青信号へ寄せられます。後工程の照合時間が短くなります。

「知っている」で止めない生成AIスキルの証明|PEP検定

PEP検定が問うのは基礎的な知識はもちろん、実務においてどのように生成AIを活用するか、プロンプトを設計するかなど“実際に使いこなす力”です。日本初の実務特化検定で、AIエージェントのように動きの速い領域もシラバスが追従。学び直しの成果を、転職・副業・社内評価で通用する客観的な根拠に変えられます。

  • 知識で止めず、プロンプト設計など“手を動かして使う力”を測る
  • CBTで全国いつでも受験可能
  • 個人の転職・副業から、社員のリスキリング成果の証明まで対応

監修|北海道大学大学院 情報科学研究院 川村 秀憲 教授
人工知能・マルチエージェントシステム研究の第一人者。観光情報学会理事ほか。

生成AIの実務に活きるPEP検定の詳細を見る →

作業時間の目安|30分音声をAIで処理すると何分かかるか

計画を立てる前に前提を固定します。前提が違えば時間は変わります。

  • 30分音声
  • 成果物:話者名なしの要点議事録、または整文済み全文
  • 照合対象:数字・固有名詞・否定表現
  • 全文逐語の完全校正ではない
整文済み全文を作る場合(作業設計用の推定)
音声条件 AI文字起こし 生成AI整形 原音照合 合計 人手で最初から起こす場合との差
静音・独話30分 5分 10分 15分 30分 手起こし120〜150分。約4〜5分の1
2〜3人会議30分 5分 15分 30分 50分 手起こし150〜180分。約3分の1
雑音・同時発話30分 5分 20分 60分以上 85分以上 手起こし180分以上。差は縮む
要点議事録を作る場合(作業設計用の推定)
音声条件 AI文字起こし 生成AI整形 原音照合 合計 人手で最初から起こす場合との差
静音・独話30分 5分 8分 10分 23分 手作業90分前後。約4分の1
2〜3人会議30分 5分 12分 20分 37分 手作業120分前後。約3分の1
雑音・同時発話30分 5分 15分 40分以上 60分以上 手作業150分以上。差は縮む

これは自社実測ではなく、作業設計用の目安です。ツール・PC性能・音質で変わります。合計時間の多くは原音照合が占めます。数字・固有名詞・否定表現を優先すると短時間で潰せます。

誤変換を見抜く仕上げ手順|原音照合の優先順位

誤変換は壊れると被害が大きい順に照合します。優先順位は次のとおりです。

  1. 数字(金額・日付・件数・パーセント)=間違えると意味が反転
  2. 固有名詞(社名・人名・型番・地名)=似た語に置換されやすい
  3. 否定表現(「〜ない」「〜ではなく」)=抜けると逆の意味になる
  4. 句読点位置=係り受けで責任や条件が変わる
誤変換 被害 確認方法
「15日」と「50日」 日程がずれ納期・会議が崩れる 原音で日付を確認
「1,500万円」と「15万円」 見積・提案書で致命傷 金額を原音とスライドで照合
「0.5%」と「5%」 数値報告の誤り 単位と桁を原音で確認
「対応できない」と「対応できる」 可否が逆転し責任問題 否定語を原音で確認
「佐藤」と「加藤」 宛名・議事録の誤り 参加者名簿と照合
「決裁」と「決済」 承認と支払いを混同 業務文脈で判断

納品前チェックリスト

  • 日付はすべて原音確認したか
  • 金額・割合・数量は資料と照合したか
  • 人名・社名・サービス名は名簿・公式表記と合わせたか
  • 「できる/できない」「する/しない」は原音確認したか
  • 決裁/決済、以外/意外、対象/対照など同音異義語を確認したか
  • 不明箇所を勝手に埋めず [不明 12:34] のように残したか

ChatGPTに整形させる前のプロンプト

以下はAI文字起こしの下書きです。
事実の追加・推測補完は禁止です。
話し言葉を書き言葉に整えてください。
数字、固有名詞、否定表現は変更せず、怪しい箇所は[要原音確認]と残してください。
意味が取れない箇所は[不明]としてください。
出力形式は「議題/決定事項/TODO/未決事項」に分けてください。

原音照合後の修正プロンプト

以下の修正メモだけを反映してください。
修正メモにない内容は変更しないでください。
表現を自然にするための言い換えも禁止です。

数字と否定表現の2つだけ原音照合すれば、致命的な誤りの大半を防げます。この照合力と工程管理は、市場で評価される具体スキルです。判断力を測る指標として、後述のPEP検定の出題範囲が使えます。

機密情報の判断フロー|社外秘の音声を入れてよいか

機密音声は投入先と設定を先に確認します。感覚で判断すると漏えいリスクが残ります。個人情報保護委員会は生成AIサービスの利用に関する注意喚起で入力情報の扱いに注意を促しています。

投入禁止の典型例

  • 顧客名・担当者名が出る商談録音
  • 未公開の売上・粗利・受注確度
  • 人事評価・面談録音
  • 契約金額・値引き条件
  • 医療・法律・金融相談の録音

確認する公式ページと文言

見るページはOpenAIのData Controls / Enterprise PrivacyTeamsのトランスクリプトMicrosoft Trust CenterZoomのAI Companion・録画/文字起こしのデータ取り扱いGoogle Workspace管理者向けのデータ保護です。

見る項目は次の英語文言です。train our models、data retention、opt out、admin control、subprocessors、data residency。この6語を検索して該当箇所を読みます。

投入前に通すチェックフロー

  1. その音声に個人情報・社外秘・契約情報が含まれるか判定する
  2. 含む場合、会社の利用規程で外部AIへの入力が許可されているか確認する
  3. 許可でも、学習利用オフ・保存期間・管理者権限・国外移転・委託先まで確認する
  4. 不安ならローカルWhisperで音声を外部送信せず処理する

学習利用オフは「モデル学習に使われにくくする設定」であって、保存・閲覧権限・国外移転・委託先リスクを消す設定ではありません。迷ったらローカルで文字起こしし、固有名詞を伏せてから整形だけAIに任せます。社内ルールとチーム教育を整えるなら、法人向けの生成AI研修で判断基準をそろえる選択肢もあります。似た判断軸は生成AIリサーチは危険?でも扱っています。

文字起こしスキルを副業・収入化する導線

単純な逐語起こしは価格競争になりやすいです。AIで初稿が作れるためです。

価値は要約・決定事項抽出・TODO化・記事化・提案素材化に移っています。書き起こし単体では売りません。

商品メニュー例

  • 会議30分 → 決定事項/TODO付き議事録
  • インタビュー60分 → 記事構成案+引用候補10個
  • 商談録音30分 → 課題・要望・失注リスク整理
  • セミナー60分 → レポート記事の下書き

見積もりの軸

価格は断定せず、次の軸で見積もります。音声分数、話者数、原音照合の範囲、専門用語の量、納品形式、機密対応の有無です。

提案文の例は次のとおりです。

AI文字起こしの下書きを使い、数字・固有名詞・否定表現を原音確認したうえで、決定事項・TODO・未決事項に整理します。単なる全文書き起こしではなく、会議後にそのまま共有できる業務文書として納品します。

「書き起こし代行」ではなく「業務文書化」で売ると単価を守れます。原本・中間物・成果物を分けると、AIが更新してよい対象が明確になります。

PEP検定で確認すべき文字起こし関連スキル

この記事で扱った文字起こしは、ツール操作だけではありません。出力検証・情報管理・業務文書化のスキルを含みます。

PEP検定は、そのうち生成AIの実務利用で必要なプロンプト設計、出力確認、リスク判断を確認する入口として使えます。対応する項目は次のとおりです。

  • プロンプトで制約条件を指定できる
  • AI出力の誤りを検証できる
  • 機密情報を投入してよいか判断できる
  • 生成AIの得意・不得意を説明できる
  • 業務文書として再利用できる形に整えられる

文字起こしを「AIに投げて終わり」ではなく、検証・整形・機密判断まで説明できる状態にしたい人は、PEP検定の出題範囲を確認します。この記事のチェックリストを見て半分以上あいまいなら、受検前に出題範囲で不足分を洗い出す価値があります。対象者・出題範囲・受検手順は公式ページに掲載されています。

次の人はまだ不要です。個人メモの文字起こしだけで足りる人、原音照合をする気がない人、機密情報の確認をせず外部AIに入れる人です。

よくある質問

生成AIの文字起こしで無料ならどれを使えばよいですか

録音済みファイルならローカルWhisper、CLOVA Note、Nottaの無料枠が候補です。その場の口述ならGoogleドキュメント音声入力が無料です。機密音声はローカルWhisperを選びます。無料枠の上限は各公式料金で確認します。

日本語の文字起こしでWhisperとNottaはどちらがよいですか

機密音声を外部送信したくないならローカルWhisperです。話者分離や共有機能を手早く使いたいならNottaです。独話では体感差が小さく、雑音・複数話者ではNottaの下書きが読みやすい傾向です。ここは推定なので、自社の音源で試写して決めます。

録音が悪い音声でも文字起こしできますか

できますが誤変換が増え、原音照合の時間が伸びます。飲食店・屋外・電話越しは赤信号です。まず録音を改善し、無理なら数字と固有名詞を全文照合する前提で使います。納品物には「AI下書き+人手確認」と明記します。

文字起こし後に議事録へ整えるプロンプトはありますか

本文の「整形させる前のプロンプト」を使います。事実の追加・推測補完を禁止し、数字・固有名詞・否定表現を変更させません。怪しい箇所は[要原音確認]、不明は[不明]で残します。出力は議題/決定事項/TODO/未決事項に分けます。

会社の会議録をChatGPTに入れてよいですか

会社の利用規程と投入先の設定次第です。顧客名・契約金額・人事評価を含む録音は投入禁止の典型です。判断は本文の機密情報の判断フローの4ステップで通します。迷う音声は素のまま外部サービスへ入れません。

副業でAI文字起こしを売るなら何を納品すべきですか

逐語起こし単体ではなく、決定事項・TODO・未決事項に整理した業務文書を納品します。インタビューなら記事構成案と引用候補を足します。検証・整形・機密判断まで説明できる状態にしたいなら、PEP検定の出題範囲で不足スキルを確認します。

「知っている」で止めない生成AIスキルの証明|PEP検定

PEP検定が問うのは基礎的な知識はもちろん、実務においてどのように生成AIを活用するか、プロンプトを設計するかなど“実際に使いこなす力”です。日本初の実務特化検定で、AIエージェントのように動きの速い領域もシラバスが追従。学び直しの成果を、転職・副業・社内評価で通用する客観的な根拠に変えられます。

  • 知識で止めず、プロンプト設計など“手を動かして使う力”を測る
  • CBTで全国いつでも受験可能
  • 個人の転職・副業から、社員のリスキリング成果の証明まで対応

監修|北海道大学大学院 情報科学研究院 川村 秀憲 教授
人工知能・マルチエージェントシステム研究の第一人者。観光情報学会理事ほか。

生成AIの実務に活きるPEP検定の詳細を見る →