9月23日の夜11時すぎ、10分32秒の動画を1本、YouTubeに公開した。
海外で実際に起きた事件を、ナレーションと切り絵のような影絵で追っていくドキュメンタリーだ。
新しく作ったチャンネルの、最初の1本になる。
作業を始めたのは9月14日。
10日間で公開まで来られたのは、3つのAIに仕事を分けたからだと思う。
ChatGPTに企画と事実確認、Codexに地図の画像、Claude(Claude Code)に動画を組み立てる道具づくりを頼んだ。
僕がやったのは、ナレーションを録ることと、できあがったものを見て「ここが変」と言うことだった。
この記事は、その分担のやり方と、途中で起きた失敗の話。事件そのものの話はしない。
分担はこうなった
| 担当 | やったこと |
|---|---|
| ChatGPT | 台本と録音用の原稿、素材の計画。公開前の事実確認。チャンネルの設計案 |
| Codex | 地図を描くプログラム(351行と、動作を確かめるテスト15本) |
| Claude | 動画を組み立てる道具の実装と検証。ほかの2つのAIが出したものの確認 |
| 僕 | ナレーションの録音。見て、聞いて、変なところを指摘する |
面白かったのは、AI同士の受け渡しだった。
Codexは地図のプログラムを書いてくれたが、自分の環境ではPythonを動かせず、「動作は未検証」と書いて返してきた。
それをClaudeが受け取って、テストを全部走らせ、中身を読んでから取り込んだ。
記録には「Codex作・Claude Code検証」と残してある。

声を録れば、あとは決まる
いちばん助かったのは、ナレーションを録ったあとの作業がほとんど要らなくなったことだ。
録音は無料の録音ソフト(Audacity)でやった。
できた音声ファイルを決まったフォルダに置くと、道具が次のことを順にやる。
- 音声を文字に起こして、どの言葉が何秒目に話されたかを調べる
- 台本の各場面の文と照らし合わせて、場面ごとの始まりと終わりの時刻を決める
- その時刻に合わせて、画面の切り替え、字幕、BGMの切り替え、効果音を並べる
- 確認用の動画と、動画編集ソフトで開けるファイルを書き出す
照らし合わせがうまくいかなかった場面には、点数が低いという印がつく。
半分以上がうまくいかなければ、全部を元の決め打ちの秒数に戻す。
録り直しても、ボタンを1回押せば全部がそろい直す。
最終版は31場面、画面の切り替えは118回になった。
1回あたり平均4.2秒。
これを手で合わせていたら、10日では終わらなかったと思う。
AIが「読まれていない」と消した一文
本番のナレーションを入れたとき、Claudeからこう報告があった。
最後の次回予告の一文が、録音の中に見つからない。
読み飛ばされたようなので、台本から外しておいた、と。
僕は読んだ覚えがあった。
動画を再生すると、9分40秒あたりでちゃんと言っている。
そう伝えると、Claudeはその区間を聞き直して、読まれていたことを認めた。
原因は、文字起こしの取りこぼしだった。
578.9秒から586.2秒までの約7秒が、文字起こしの結果からまるごと抜けていた。
声はあるのに、文字にならなかった。
Claudeは「文字がない=読まれていない」と判断して、音声そのものは確かめなかった。
直し方は3つあった。
- 消した一文を台本と録音原稿に戻す
- 「文字はないのに、音は鳴っている区間」を自動で見つけて、そこだけ文字起こしをやり直す仕組みを足す
- 台本を削る前には、必ずその区間の音を直接聞く、と決める
やり直したあと、その場面の照らし合わせの点数は0.69から0.93に上がった。
AIは、自分の手元にある情報をそのまま信じる。
文字起こしの結果しか見ていなければ、そこにない言葉は「なかった」ことになる。
「読んだ覚えがある」という一言が、それを止めた。
公開の前日、事実確認で4つ出てきた
動画ができあがった段階で、台本をChatGPTにもう一度渡して、事実を確かめてもらった。
事件の記録や当時の報道と照らし合わせてもらうと、4つの誤りが出てきた。
- 年代の書き方が、ある出来事の起きた年を誤解させるものになっていた
- 評決の日と、刑が決まった日が混ざっていた
- 締めくくりで触れたイギリスの別の事件について、使われたDNA鑑定の種類を取り違えていた。実際は個体をそこまで絞り込めない種類の鑑定で、裁かれた罪の名前も違っていた
- ある虫の説明が大ざっぱすぎた
3つめは、もともとClaudeが下調べで書いた部分だった。
Claudeは「調べが浅く、事実誤認でした」と認めて、台本を直した。
直した5場面は、僕が録り直した。
台本を書いたAIと、確かめるAIを分けておいたのがよかった。
同じAIに「確認して」と頼むより、別のAIに一次資料から当たってもらうほうが、誤りは見つかりやすい。
音楽は1曲ずつ、ライセンスの欄を目で見た
BGMは17曲、効果音は12個使った。
どれもYouTubeのオーディオライブラリか、無料の音楽サイトから集めたものだ。
ライセンスの確認は、曲名で判断しなかった。
YouTube Studioで1曲ずつ検索して、ライセンスの欄を目で見た。
ファイルと曲のページが同じものかは、再生時間が一致するかで確かめた。
これには理由がある。
同じ曲名でも、別の人が演奏した版は、作者名の表示が必要なライセンスになっていることがあった。
曲名だけで「大丈夫」と決めていたら、表示が抜けていたところだった。
確かめた結果は、曲名・作者・出どころ・確認した日・ライセンスの文言を1か所の記録にまとめてある。
切り抜きの道具が、商用に使えないものだった
影絵の素材は、手持ちの写真から人や猫の輪郭だけを切り抜いて作った。
顔も模様も残らない。
途中で、手の写真を1枚切り抜くのに85秒かかることに気づいた。
遅すぎるので調べると、切り抜きの道具が、何も指定しないと重い別のモデルを使う作りになっていた。
しかもそのモデルは、商用には使えないライセンスだった。
収益化するチャンネルで使うのはまずい。
商用に使えるモデルに切り替えて、そのモデルで作った素材は全部作り直した。
1枚あたりの時間も約7秒に縮んだ。
速さの問題を追いかけていなかったら、ライセンスの問題には気づかなかったと思う。
「赤い字が安っぽい」
試しに作った低画質版を見て、僕が言ったのはこれだった。
画面に出る文字の中で、毎回どこかの言葉が赤くなる。
「小さな」のような、どうでもいい言葉まで赤い。
カチッという効果音も鳴りすぎていた。
道具は、1つの文の中で「いちばんそれらしい言葉」を必ず1つ選んで赤くする作りになっていた。
そこで、強調する言葉は台本に書いておき、書いていない文は強調しないようにした。
見せ方の型も4種類にして、同じ型が続かないようにした。
効果音は42回から7回に減った。
AIは「毎回なにかを強調する」ことを、丁寧さだと考えていたのかもしれない。
見る側からすると、全部が強調されているのは、何も強調されていないのと同じだった。
数字でふり返る
| 項目 | 数字 |
|---|---|
| 作業期間 | 9月14日〜9月23日の10日間 |
| 動画の長さ | 10分32秒 |
| 場面 / 画面の切り替え | 31場面 / 118回 |
| BGM / 効果音 | 17曲 / 12個(全部ライセンスを確認) |
| 声とBGMの音量の差 | 約13dB → 約20dB(声が聞き取りやすくなった) |
| 道具の動作を確かめるテスト | 18本 → 98本 |
| カチッという効果音 | 42回 → 7回 |
やってみて分かったこと
AIを3つ使うと、作業が3倍速くなるわけではない。
速くなったのは、それぞれの得意なところで止まらずに済んだからだ。
台本を書くAI、確かめるAI、組み立てるAIを分けたことで、1つのAIの思い込みを、別のAIか僕が止められた。
失敗はどれも、AIが「手元の情報だけで判断した」ところで起きていた。
文字起こしにない言葉を消した。
下調べの記憶で鑑定の種類を書いた。
道具の初期設定を確かめずに使った。
止めたのは、音を聞く、一次資料に当たる、遅さの理由を調べる、という地味な確認だった。
次の回の準備も始めている。今度は、録る前にもう一度、事実確認を挟むつもりだ。
下の動画を見てもし気に入ってくれたら、チャンネル登録もぜひ。






