読む文と聴く文の断層 — どちらが優れているかではなく、読み手の立場で効果が反転する

★ 0
🎧 この記事を音声で聴く(12:13)
※ この記事の音声版は edge-tts (Microsoft) で生成しています。息継ぎや疑問文の語尾など、人間の話し方と異なる箇所があります。

自分で書いた文章を自分で校閲するのは、思っているより難しいことです。何度も読み返したはずの原稿から、公開した後で誤字が見つかる。意味の飛んだ一文が、平気で残っている。書いた本人がいちばん見落とすというのは、たぶん多くの人が経験していることだと思います。

僕はこの数ヶ月、ジャーナルの原稿を音声に変換して、耳で聴きながらチェックする工程を回してきました。きっかけは音声読み上げ機能を記事に載せるためだったのですが、やっているうちに、思いがけない副産物に気づきました。目で何度読んでも見つからなかった粗が、耳で聴くと引っかかるんです。

以前、コンテンツ制作のパイプラインを作った話を書いたとき、この現象を 「音声化が意図せず品質管理の機会になった、面白い副産物」 として、一文だけ触れました。今日は、その副産物を背骨として掘り下げます。なぜ目で読むと見落とし、耳で聴くと捕まるのか。そして掘っていくうちに、もっと大きな問いにぶつかりました。「読む文と聴く文は、どちらが優れているのか」という問いの立て方そのものが、間違っていたのです。

はじめは「文の性質の違い」だと思っていた

この工程を始めた当初、僕の頭の中にあったのは 「音声向けの原稿構造ルール」という技術的な発想 でした。

読む文と聴く文は、文の性質が違う。だから、音声に向く原稿には、音声に向く書き方のルールがあるはずだ。テーブルは音声だと冗長になるから畳む。長すぎる一文は途中で息継ぎが入らないから短く切る。括弧の補足は読み上げに載せると鬱陶しいから外す。こういうルールを整理して原稿に適用すれば、読む文を聴く文に「変換」できる。そう考えていました。

つまり僕は、断層を文の側にあるものとして捉えていたわけです。読む文という性質と、聴く文という性質があって、その差を技術で吸収すればいい。仮説としては、わりと素直だと思います。実際、最初に踏んだ問題のいくつかは、本当に技術ルールで片づきました。

目では読めるのに、耳で壊れる三つの断層

自作の音声パイプラインは、edge-tts というエンジンを使っています。Markdownの原稿を読み込んで、音声向けに整形し、MP3を出力する。この整形の過程で、「目では問題なく読めるのに、耳に通すと壊れる」 箇所が、次々に出てきました。具体的に三つ、紹介します。

テーブルとFAQが、音声で異常な尺になる

最初に踏んだのは、尺の問題です。記事の中のテーブルや、末尾のFAQ。目で読むぶんには、むしろ情報が整理されて読みやすい部分です。ところが、これをそのまま読み上げると、異常に長い時間がかかる。表のセルを一つずつ律儀に読み上げてしまうからです。

解決策は、読み上げたくない範囲を専用のタグで囲んで、音声生成のときだけ除外することでした。これ自体は単純なのですが、厄介だったのは、このタグの入れ子です。括弧の補足の中に、さらに読み上げ対象の文が混ざっていたりすると、どこからどこまでを消すのかの判定が崩れる。目で見れば一目瞭然の構造が、音声化のロジックでは曖昧になる。ここで一度、つまずきました。

漢字が、文脈ごと読み崩れる

次が、読みの問題です。日本語の漢字は、同じ文字でも文脈で読みが変わります。人名、技術用語、助数詞。これらを機械にそのまま渡すと、平気で違う読みを当ててきます。

そこで、読み方の辞書をCSVファイルで管理することにしました。「この単語は、この読みで」と一行ずつ登録していく。ところが、ここにも罠がありました。読みをカンマ区切りで書くので、読み自体にカンマが入ると区切りが崩れる。短い単語を先に登録すると、長い単語の一部に部分一致して、意図しない置換が起きる。助数詞のような短い語が、別の語の読み変換に干渉する。一つ直すと、別のところが崩れる。目で原稿を読んでいる限り、こんな問題は存在すらしません。耳に通して初めて、表に出てくるんです。

長い一文が、耳で一息に崩れる

三つ目は、一文の長さの問題です。

目で読むぶんには、少し長いくらいの一文は、むしろ滑らかに追えます。句読点で視線を休めながら、自分のペースで進められるからです。ところが、同じ一文を読み上げると、エンジンは息継ぎなしで一息に読み切ろうとする。聴いているこちらは、意味を受け取りきる前に、次々と流されてしまう。目では一文だった構造が、耳では「長すぎて入ってこない塊」に変わるんです。

解決策は単純で、音声に回す原稿は、一文を短く切る。読む文なら許される長さが、聴く文では負荷になる。だから句点を増やして、一息で受け取れる単位に畳んでおく必要がありました。

この三つに共通しているのは、どれも 「目で読むぶんには、まったく問題がない」 という点です。原稿は、文字としては完成している。なのに、音に変換した瞬間に壊れる。僕はこれを、読む文と聴く文のあいだにある物理的な断層の証拠 だと思っています。

断層は、文の側ではなく読み手の側にあった

ここまでは、僕の仮説どおりでした。読む文と聴く文には性質の差があって、技術ルールでその差を吸収していく。順調な作業です。

ところが、これらの断層を一つずつ直しているうちに、最初の自分の校閲体験のことが引っかかり始めました。目で見落とした誤字を、耳が捕まえる。あれは、文の性質の問題なのだろうか。文章はまったく同じものです。変わったのは、僕がそれを目で受け取ったか、耳で受け取ったか、それだけです。だとすれば、断層は文の側ではなく、受け取る僕の側にあったことになる。

ここで、一つのパラドックスに行き当たりました。不可逆であることが、かえって精度を生む、という逆説です。

目で読むとき、僕はいつでも前の行に戻れます。先を読んで、また戻って、自由に行き来できる。この自由は便利なのですが、自分の文章に対しては裏目に出ます。書いた本人は、何を書こうとしたかをすでに知っている。だから脳が、文字を一つずつ照合する前に、意図のほうで先回りして意味を埋めてしまう。実際に書かれている文字ではなく、書いたつもりの文章を読んでしまうわけです。これが、自分の誤字を自分で見落とす正体だと、僕は考えています。

音声には、その自由がありません。聴くという行為は不可逆で、線形です。戻れないし、飛ばせない。前から順に、一音ずつ受け取るしかない。この不自由さが、脳の先回りを強制的にオフにする。書いたつもりの文章ではなく、実際にそこにある文章の流れを、時系列として判定させられる。だから粗が露出するのだと思います。

これは僕の解釈ですが、近い知見は研究にもあります。校正の場面で、黙読よりも声に出して読むほうが、誤りの検出率が上がることが報告されています(Cushing & Bodner, 2022, Journal of Applied Research in Memory and Cognition)。その研究が面白いのは、参加者がこの効果を事前に予期できず、効果が出た後ですら「黙読でも同じだろう」と過小評価していた、という点です。実測と実感がズレる。僕が自分のパイプラインで偶然この現象に出くわすまで、その威力を知らなかったのと、よく似ています。

正確に言えば、僕の場合は自分で音読しているのではなく、機械の読み上げを聴いている側です。声に出す校正と、耳で聴く校正は、まったく同じではありません。ただ、「黙読の先回りを断つ」という一点では、地続きだと感じています。

では「どちらが良い文か」は、無意味な問いなのか

さて、ここで自分に厳しく疑いをかけておきます。

もし音声の不可逆性がそんなに優れているなら、何でもかんでも耳で受け取ればいい、という話になりそうです。でも、それは明らかに違う。僕自身、必要な箇所だけを拾い読みしたいときは、目で読みます。全体の構造を俯瞰したいときも、目です。音声で本を一冊「精読」しろと言われたら、たぶん無理だと感じます。

これは、データのほうでも裏が取れます。読みと聴きの理解度を比較した大規模なメタ分析(Clinton-Lisell, 2022, Review of Educational Research、46研究・約4,700人)では、全体としては読みと聴きの理解度に大きな差はありませんでした。ところが条件を分けると、話が変わります。この分析によれば、自分でペースを握れる読みのほうが有利で、とくに行間を読むような推論的な理解では、読みが明確に勝っていました。

つまり、同じ不可逆性が、場面によって反転するのです。自分の文章を校閲するときには、戻れないことが武器になる。粗が露出するから。けれど、難しい内容を理解したいときには、戻れないことが足枷になる。立ち止まって読み返せないから。性質は一つで、評価が裏返る。

ここで、もう一つの可能性も考えておくべきです。効いているのは、本当に「読む・聴く」という様式の違いなのだろうか。それとも、文章の難しさや、読む目的のほうなのか。先のメタ分析が示しているのは、むしろ後者です。様式そのものが万能の優劣を決めるのではなく、目的(校閲なのか、理解なのか) と、 自分でペースを握れるかどうか が、効き方を決めている。だから 「読む文と聴く文、どちらが優れているか」という問いは、最初から立て方が間違っていたのだ と思います。

立場と制御権の地図

ここまでの話を、一枚の表にまとめてみます。縦軸は読み手の立場、横軸は効く形式と、その理由です。

読み手の立場・意識効く形式なぜ
自分の文を校閲する(粗・意図の飛びを出す)聴く不可逆が先回りを断ち、流れとして判定させる
全体構造を俯瞰したい読む空間的に把握でき、好きな順で行き来できる
必要な箇所だけ抽出したい(速さ優先)読むスキップと検索の自由がある
身体を動かしながら吸収したい聴く目と手が空き、線形が「ながら」に向く
難しい内容を精読・理解したい読む難所で立ち止まり、読み返せる
正確な引用・位置を覚えたい読むページ上の位置が視覚的な記憶の手がかりになる

こうして並べてみると、形式を分けている軸が一本、見えてきます。制御権を、どちらに置くかです。

読むという形式は、読み手に制御権を渡します。どこから読むか、どこで止まるか、どこに戻るかを、読み手が決められる。聴くという形式は、その制御権を奪います。流れは送り手が握り、読み手はそれに乗るしかない。校閲のように制御権を手放したほうが良い場面もあれば、精読のように握っていたい場面もある。どちらが上ということではなく、立場によって最適が入れ替わるだけなのです。

制御権を、誰に渡すか

ここまで来て、最初の問いの立て方が間違っていたと、はっきり言えます。「読む文と聴く文、どちらが優れているか」ではなかった。文はずっと同じで、変わっていたのは読み手の立場のほうでした。

だとすれば、書き手の仕事は「良い文を書く」ことではなかったのだと思います。どの立場の読み手に、どの制御権を渡すか。行き来の自由を渡すのか、流れを保証する代わりにその自由を奪うのか。それを選んで、文を設計すること。僕はこれまで、それを無意識にやっていたのでした。

そう気づいてから、原稿を書く手順が一つ増えました。書き終えたら、必ず一度、耳で通す。目の先回りが効かない不可逆の流れに自分の文章を置いて、意図が連続しているかを確かめる。テーブルは読み上げ対象から畳み、固有名詞は読みの辞書に登録し、長い一文は短く切る。この三つは、もう手順書になりました。

ただ、手順の話で終わらせたくはありません。この一手間が効くのは、「校閲」という立場を選んだときだけだからです。抽出したいときは目に戻すし、ながら聞きの相手には耳のままでいい。同じ文章でも、渡す制御権を立場ごとに変える。それが、次に原稿を書くときの、僕の一行目のルールです。

FAQ

音声で校閲すると、本当に誤字が見つかるんですか?

僕の体感では、目で見落とした意図の飛びや誤字が、耳に通すと引っかかります。校正の研究でも、黙読より声に出して読むほうが誤りの検出率が上がると報告されています(Cushing & Bodner, 2022)。ただし、これは「校閲」という目的に限った話です。

読むのと聴くの、結局どちらが優れているんですか?

この記事の結論は「その問いの立て方が間違っている」です。文は同じで、効き方を決めるのは読み手の立場と目的です。校閲なら聴く、難しい内容の精読なら読む、というように最適が入れ替わります。

「不可逆だから精度が上がる」のメカニズムは証明されているんですか?

完全には証明されていません。黙読時に脳が意味を先取りすることや、聴取が前から順の処理を強いることは個別に知られていますが、「だから音声校閲で粗が捕まる」という因果を直接示した研究は、僕が探した範囲では見つかりませんでした。記事では、確立した知見をつないだ仮説として扱い、自分の一次体験で補強しています。

no-audio や読みの辞書というのは何ですか?

僕が自作している音声読み上げパイプラインの仕組みです。読み上げたくない範囲を囲んで音声から除外するタグや、漢字や固有名詞の読み方を登録するCSVの辞書ファイルのことで、記事を音声化するときの、いわば縁の下の道具です。

自分の文章を音声で確認する、手軽な方法はありますか?

専用のパイプラインがなくても、スマホやPCの読み上げ機能で代用できます。大事なのは、自分で目で追わずに、不可逆の流れに身を置くことです。戻れない状態で聴くと、書いたつもりと書けているものの差が、表に出てきます。

この記事が参考になったら

Share