調音合成について
調音合成、またはアーティキュレートリー・シンセシスとは、人間の
声道の構造を基盤に音声を生成するための計算手法の一つです。この方法では、
舌や
唇、
顎といった調音器官の配置の変化によって
声道の形を制御し、それにより生じる空気の流れをデジタル技術でシミュレーションします。こうして生成される音声は、自然な言語発音に近いものとなります。
歴史の概略
調音合成の起源は古代にさかのぼります。歴史的な意味での
音声合成は、クリスティアン・クラッツェンシュタインや
ヴォルフガング・フォン・ケンペレンなどの研究者によって確立されました。彼らは喋る機械の製作に取り組み、
音声合成技術の第一歩を踏み出しました。特にケンペレンは1791年にその成果を発表し、以降の
音声合成研究に大きな影響を与えました。
電子式声道の発展
1950年代から60年代にかけて、
音声合成技術は急速に進化しました。最初の電子式アナログ
声道は、静的なモデルが主流でしたが、次第に動的な
声道モデルが登場します。ロゼン(1958)は動的な
声道を組み立て、コンピュータ制御にも挑戦しました。この時期には、多くの科学者がアナログ
声道に関する研究を進め、よりリアルな音声シミュレーションが可能になりました。
ソフトウェアによる調音シンセサイザーの登場
1970年代半ば、Haskins Laboratoriesにおいて、フィリップ・ルービンやトム・ベア、ポール・マーメルスタインらによってASY(Articulatory Synthesis)が開発されました。このシンセサイザーは、
声道のモデルに基づく音声生成の新しい計算手法を提供しました。また、前田眞治による
舌の形状制御を用いたモデルも、調音合成の発展に寄与しています。
現代の進展
近年の技術革新により、調音合成方法は一層進化しています。Haskins CASYモデルに見られるように、MRIデータを用いて
声道の三次元モデルを構築する技術が登場しました。この新しいアプローチは、実際の生体のデータに基づくため、より正確な音声生成が可能となります。また、Olov Engwallによるフル3次元調音合成モデルや、Peter Birkholzが開発した幾何学的な3次元調音合成モデルも現れています。さらに、ArtiSynthプロジェクトでは、3次元の生体力学モデリングツールが提供され、人間の
声道や上気道の理解が深まっています。
商用システムの発展
1980年代後半には、
カナダの
カルガリー大学のスピンオフ企業であるTrillium Sound Researchによって、商用の調音スピーチシステムが開発されました。このシステムは、
GNU General Public Licenseの下で公開され、Gnuspeechという名称で知られています。1994年に初めて市場に登場した際には、伝送路アナログを利用し、人間の発声を模擬する高度な機能を備えていました。
まとめ
調音合成は、計算技術の進歩とともに、音声生成の理解を深める重要な分野です。
音声合成の過去から現在までの技術の進展を振り返り、今後の可能性についても探求していくことが求められています。今後の調音合成の技術がどのように発展していくのか、注目が集まります。