動画の字幕づくりは、AIでどこまで無人化できるか
字幕づくりは、ほぼ全部を機械に渡せる。
残るのは「読める形かどうか」を決める側で、ここは人間が定義を書かないと機械は一歩も動けない。
うちは毎朝04:00に動画工場が起動し、台本から音声、字幕までを人の手を通さずに仕上げている。
字幕は「文字起こし」ではない
字幕づくりを、音声を文字にする作業だと考えると設計を間違える。文字にするのは最初の一手でしかない。実際の工程は、文字にしたあと、いつからいつまで出すかを決め、画面に収まる幅で行を割り、表記を揃え、編集ソフトが読める形式に変換するところまで続く。手間の大半は、文字起こしより後ろにある。
うちの場合、そもそも台本が先にある。AIが書いた台本を音声にし、その音声に台本を突き合わせて字幕にする。聞き取りの精度を競う必要がない分、線引きは前に進めやすい。
工程分解表——「動画に字幕を載せる」工程
| 工程 | 担い手 | 無人化度 |
|---|---|---|
| 音声から文字を起こす(台本がある場合は突き合わせ) | 機械 | 完全無人 |
| 各行の表示開始・終了の時刻を決める | 機械 | 完全無人 |
| 画面幅に合わせて行を割る | 機械 | 完全無人 |
| 行頭・行末に置いてはいけない文字の回避 | 機械 | 完全無人 |
| 数字・記号・単位の表記統一 | 機械 | 完全無人 |
| 編集ソフトが読み込める形式への変換 | 機械 | 完全無人 |
| 変換結果が本当に読み込めるかの確認 | 機械 | 検品のみ人間 |
| 固有名詞・読み方の辞書づくり | 人間 | 補助 |
| 「読みやすい」の定義を決める | 人間 | 人間必須 |
| 作り直しが必要な範囲の線引き | 人間 | 人間必須 |
できる側
時刻の割り当て、行分け、表記の統一は、規則さえ書けば機械が正確に繰り返す。人間より速く、疲れず、気分で揺れない。
規則を書いた例を一つ出す。2026年8月4日、うちは字幕の表記について二つ決めた。行頭と行末に来てはいけない文字を出口の側で必ず回避すること。そして画面に出す数字は漢数字ではなく算用数字にすること。決めたことを工程の出口に置いたので、以後どの案件から作っても同じ形で出てくる。規則を人間の注意力に置くと揺れるが、工程の出口に置くと揺れない。
もう一つ、機械が得意なのは変換の検査だ。字幕を編集ソフトの形式に書き出す処理には、途中で失敗しても最後まで走り切ってしまう書き方がある。出来上がったファイルは存在するのに中身が空、という状態になる。うちはこの工程に、対象が0件なら異常として扱う判定と、終了コードをはっきり返す仕組みを入れた。ファイルがあることと、中身があることは違う。
難しい側
難しいのは、「読みやすい」を決めるところにある。一行を何文字までにするか、何秒出しておくか、話し言葉の言い直しをそのまま出すか整えるか。これは正解が無く、チャンネルの性格と視聴者によって変わる。機械は決められた幅で割ることはできるが、その幅がふさわしいかを判断できない。
もう一つ難しいのが、作り直しの範囲を決めることだ。2026年8月11日、うちは字幕を作り直す処理が、条件の書き方のせいで多数の案件を素通りしていたのを見つけた。すでに一つでも出力があれば「済み」と見なす作りだったため、規則を更新しても古い形のまま残った案件に手が入らなかった。機械は指示どおりに動いていて、間違っていたのは「済み」の定義のほうだった。
失敗はぜんぶ、AIの能力ではなく、人間の設計の穴だった。字幕工程で人間に残るのは、作業ではなく定義を書く仕事になる。
自社の実例
うちでは毎朝03:00に講演コンテンツの制作工場が起動し、台本一式を無人で納品している。毎朝04:00には動画工場が起動し、台本から音声、字幕までが人の手を通らずに仕上がる。長尺は2本/日の設計で回している。成果物の一次チェック——誤字、規格崩れ、禁止表現——も、機械チェックとして実装済みだ。5分ごとにコレクターが全AI社員の稼働を記録し、mon-ai.jp の出勤板にライブ表示している。
この記事もそうだ。AI社員が書き、機械検品を通ったものだけが無人で公開される。台帳に無い数字が本文に混ざれば、その日は公開されない。
導入までの手順
- 自社の字幕づくりを、文字起こし・時刻決め・行分け・表記統一・書き出しに分けて書き出す
- 「読みやすい」の定義を一枚の紙に落とす。一行の文字数、表示時間、数字と記号の書き方まで決め切る
- 書き出した結果が本当に読み込めるかを機械に検査させ、対象が0件のときを異常として扱う
この線は、会社ごとに引き直せる。どこまでを機械に任せ、どの判断を人間が持つのか——その線引きは実装設計図で一緒に引けるし、まず話だけ聞きたいなら無料相談から始められる。