読む・聴く・観る — 様式の階段を、全部自分でやってみてわかったこと

★ 0
🎧 この記事を音声で聴く(8:38)
※ この記事の音声版は edge-tts (Microsoft) で生成しています。息継ぎや疑問文の語尾など、人間の話し方と異なる箇所があります。

僕は、同じ自分の思考を、いろんな形で外に出してきました。
文章で書く。音声に変換して聴けるようにする。
AIで曲にする。歌詞に映像をつけて、観られるようにする。
最初はただ、「いろんな媒体で発信している」くらいの認識でした。ところが、全部を自分の手でやってみて、あることに気づきました。読む・聴く・観るは、横並びの選択肢ではなかった。あいだに、階段があったんです。

下から、文字を読む。その上に、声で聴く。さらに上に、音楽で聴く。いちばん上に、映像で観る。一段のぼるごとに、何かが足され、何かが失われていく。今日は、その階段の構造を、全様式の当事者として整理してみます。

様式には、階段がある

具体的に、自分がやってきたことを並べてみます。

ジャーナルの記事は、文字です。読むものです。それを音声読み上げのパイプラインに通すと、声で「聴く」ものになる。さらに、同じ主題をAIで曲にすると、同じ「聴く」でも、朗読とはまるで違う深さの聴くになる。そして、歌詞に映像を同期させてMVやリールにすると、今度は「観る」ものになります。

この順番には、方向があります。文字から映像へ向かって、感覚の次元が一つずつ増えていく。文字は、視覚で受け取る記号だけ。声がつくと、時間と抑揚と「他者の声」が乗る。音楽になると、旋律とリズムと感情が乗る。映像になると、身体と空間と、その場の臨場感が乗る。足し算です。

問題は、この足し算が、いいことばかりではなかった、という点でした。

次元が増えるほど、制御権と意味解像度は下がる

階段をのぼると、二つのものが減っていきます。

一つは、受け手の制御権です。文字を読むとき、読者はどこから読むか、どこで止まるか、どこに戻るかを、自分で決められます。制御は完全に読者の手にある。声で聴くと、流れは送り手のペースになる。音楽になると、もっと送り手が握る。映像なら、ほぼ完全に送り手が時間を支配します。のぼるほど、受け手は自由を手放して、送り手の流れに乗るしかなくなる。

このあたりは、以前読む文と聴く文の断層で、「制御権をどちらに置くか」という形で書きました。あの記事は、この階段の一段目と二段目、つまり読むと聴くのあいだを、校閲という立場から拡大したものです。今日は、その軸を階段の全体に広げています。

もう一つ減るのは、意味の解像度です。文字は、最も抽象的な記号です。だからこそ、読み手は一語一語の意味を、自分の頭の中で正確に組み立てられる。論理を追うのに、文字がいちばん向いています。ところが音楽になると、歌詞は旋律に溶けて、細かい意味は取りづらくなる。映像は、文脈で大づかみに伝わるけれど、一語の正確さは文字にかなわない。抽象的な様式ほど、意味は高い解像度で渡せる。これが、のぼると失われるものの正体です。

代わりに、情動と記憶は深くなる

では、何のために階段をのぼるのか。失うばかりではないからです。のぼると、二つのものが深くなります。情動と、記憶への残りやすさです。

いちばんわかりやすいのが、音楽でした。AIで曲を作っていて、何度も体感したことがあります。歌詞が完全に聞き取れなくても、曲は刺さる。意味として何を言っているか追えなくても、旋律とリズムだけで、感情が動いてしまう。

これは、気のせいではないようです。音楽は、歌詞の意味を介さずに感情を喚起します。歌のない器楽でも、人は鳥肌が立つような強い情動反応(chills、frisson と呼ばれます)を起こすことが研究で確認されています(Harrison & Loui, 2014, Frontiers in Psychology)。テンポや音量や響きそのものが、言葉を通さずに、覚醒と感情を運ぶ。だから音楽は、意味の解像度をわざと犠牲にして、情動を取りに行く様式なんだと思います。

そして、情動が深いほど、記憶に残ります。強い感情を伴った経験ほど長く残る、というのは、脳の仕組みとして知られています。情動の喚起時に出るホルモンが記憶の固定を強め、その中核を扁桃体が担っている、と整理されています(McGaugh, 2004, Annual Review of Neuroscience)。

つまり、こういうシーソーです。様式が次元を増やすほど、制御権と意味解像度は下がり、代わりに情動と記憶は深くなる。抽象の「読む」と、体験の「観る」が、両端で釣り合っている。

ただ、ここで正直に留保を一つ置きます。次元を増やせば必ず情動も記憶も増す、という単純な話ではありません。没入度の高い映像が、かえって内容の記憶を下げた、という実験もあります(Bujić ほか, 2023, International Journal of Human-Computer Studies)。情報を詰めすぎれば、認知の負荷で学習はむしろ落ちる。様式は、効果の上限を動かす一要因にすぎなくて、最後に効くのは中身の質です。階段は、質までは保証してくれません。

AIは、その階段を上り下りさせる変換器になった

ここに、AIが入ってきます。

少し前まで、様式の階段を移動するのは、とても重い作業でした。文章を舞台にするのも、映像にするのも、別の専門家とチームと予算が要った。ところが今は、文字はClaudeで、音楽はSunoで、映像はRemotionで、一人で様式のあいだを行き来できます。AIは、様式の階段を上り下りさせる変換器になったんです。

以前コンテンツ制作のパイプラインを作った話を書きましたが、あれは「1つのソースから資料を量産する」という、効率の話でした。今日のはその先です。同じ思考を別の様式に移すと、制御権も、意味の解像度も、情動も、ぜんぶ変わる。量産ではなく、様式を変えるたびに、伝わり方そのものが組み変わる。AIは、その組み替えを一人でやれるようにした。ここが、僕にとっては効率よりずっと面白いところでした。

様式を変えても、「同じ作品」なのか

そうなると、当然の疑問が出てきます。文字で書いた思考と、それを曲にしたものと、映像にしたものは、「同じ作品」なのだろうか。

やってみた実感では、同じではありませんでした。様式を変えると、乗る「主観性」の種類が変わるんです。文字に乗るのは、論理と構造の主観性。音楽に乗るのは、情動と気分の主観性。映像に乗るのは、身体と空間の主観性。同じ自分の中から出ているのに、文字では出てこなかった面が、曲にすると出てくる。複数の様式をやるというのは、同じ主観性の、別の面を出していることなのだと思います。

面白いのは、もう「文字が原典」とは限らなくなっていることです。AIで作る曲は、もとになる小説や詩があるわけではなく、最初から音楽として生まれます。原典があって、それを変換していく、という一方通行ではない。どの様式からでも始められて、そこから階段を上り下りできる。原典という概念自体が、少し揺らいでいます。

同じ主観性の、いくつもの面

文章を書いて、音声にして、曲にして、映像にする。これを全部一人でやってきて、ようやく言葉にできたのが、この「様式の階段」でした。のぼれば情動が深まり、おりれば意味が澄む。どちらがうえということではなく、出したい主観性の面によって、選ぶ段が変わるだけです。

ここから先に、もう一段大きな話があります。なぜ僕が、文章でも音楽でも映像でも、同じことを出し続けているのか。それはたぶん、「主観性をAIで形にする」 という、自分の根っこの話につながっています。ただ、それを今日ここで広げると、階段の話がぼやけてしまう。だから今日は、入口の手前で止めておきます。

確かなのは、一つです。様式は、優劣ではなく、主観性の出口だった。どの出口を選ぶかは、何を伝えたいかで決まる。そして今は、その出口を、AIで全部開けられる時代になっています。

FAQ

「様式の階段」というのは、上の様式ほど優れているという意味ですか?

いいえ、逆です。優劣の話ではありません。のぼると情動と記憶は深まりますが、受け手の制御権と意味の解像度は下がります。何を伝えたいかによって、向いている段が変わるだけです。

文章・音楽・映像で同じ内容を出すのは、二度手間ではないんですか?

同じ内容に見えて、様式が変わると「乗る主観性」の種類が変わります。文字では論理が、音楽では情動が、映像では身体感覚が前に出る。だから二度手間というより、同じ思考の別の面を出している感覚に近いです。

AIがあれば、誰でも様式を行き来できるんですか?

文字はClaude、音楽はSuno、映像はRemotionというように、様式変換のハードルは大きく下がりました。ただし、様式は効果の上限を動かす一要因にすぎず、最後に効くのは中身の質です。AIは階段を上り下りしやすくしますが、質までは保証してくれません。

この記事が参考になったら

Share