Pengenalan ucapan - Wikipedia
Reputasi bicara adalah subbidang interdisipliner teknologi komputer dan linguistik komputasi yang mengembangkan metodologi dan teknologi yang memungkinkan popularitas dan terjemahan bahasa lisan ke dalam konten tekstual dengan bantuan sistem komputer. Hal ini juga disebut popularitas bicara terkomputerisasi (ASR), reputasi bicara komputer atau pidato ke teks (STT). Ini membawa teknologi dan penelitian di bidang ilmu komputer, linguistik dan teknik komputer.
Beberapa struktur pengenalan suara memerlukan "pendidikan" (juga disebut "pendaftaran") di mana pembicara karakter membaca teks atau kosakata terisolasi ke dalam mesin. Mesin menganalisis suara unik karakter dan memanfaatkannya untuk lagu terbaik popularitas pidato orang itu, terjadi dalam akurasi yang dipercepat. Sistem yang tidak menggunakan sekolah dikenal sebagai sistem "speaker-impartial"[1]. Sistem yang menggunakan pendidikan disebut sebagai "speaker established".
Program popularitas ucapan mencakup antarmuka pengguna suara termasuk panggilan suara (misalnya "call home"), routing nama (misalnya "Saya benar-benar ingin melakukan panggilan perolehan"), kontrol peralatan domotic, mencari frase kunci (misalnya menemukan podcast di mana frasa unik diucapkan), entri statistik sederhana (misalnya, datang ke berbagai kartu kredit), pendidikan dokumen tergantung (misalnya laporan radiologi),mencari tahu karakteristik pembicara, pemrosesan ucapan-ke-teks (misalnya, pengolah frase atau email), dan pesawat terbang (biasanya disebut input suara langsung).
Istilah popularitas suara[tiga][4][5] atau identifikasi pembicara[6][7][8] mengacu pada mencari tahu pembicara, bukan apa yang mereka umumkan. Mengenali pembicara dapat menyederhanakan usaha menerjemahkan pidato dalam sistem yang telah dilatih pada suara individu yang dipilih atau dapat digunakan untuk mengotentikasi atau mengkonfirmasi identitas pembicara sebagai bagian dari proses keamanan.
Dari sikap era, pengenalan ucapan memiliki sejarah panjang dengan beberapa gelombang inovasi utama. Baru-baru ini, bidang ini mendapat manfaat dari kemajuan dalam mengenal dan informasi besar. Kemajuan ini dibuktikan sekarang tidak paling sederhana oleh lonjakan makalah instruksional yang diposting di lapangan, tetapi yang lebih penting melalui adopsi bisnis global dari berbagai strategi penguasaan mendalam dalam merancang dan menerapkan struktur popularitas bicara. Riwayat[edit]
Wilayah utama pertumbuhan adalah: panjang kosakata, kemandirian pembicara, dan kecepatan pemrosesan. Pra-1970[edit]Tahun 1952 - Tiga peneliti Bell Labs, Stephen Balashek,[9] R. Biddulph, dan K. H. Davis membangun sebuah sistem yang dikenal sebagai "Audrey"[10] untuk reputasi digit pembicara yang belum menikah. Sistem mereka menemukan formants dalam spektrum kekuasaan dari setiap ucapan. [11]Tahun 1960 - Gunnar Fant mengembangkan dan memposting model filter sumber produksi ucapan.Tahun 1962 - IBM mendirikan fungsi pengenalan suara perangkat "Shoebox" enam belas kata di Pameran Dunia 1962. [12]Tahun 1966 - Linear predictive coding (LPC), metode pengkodean pidato, pertama kali diusulkan dengan menggunakan Fumitada Itakura dari Nagoya University dan Shuzo Saito dari Nippon Telegraph and Telephone (NTT), pada saat yang sama dengan bekerja pada reputasi pidato. [tiga belas]Tahun 1969 - Pendanaan di Bell Labs mengering selama bertahun-tahun sementara, pada tahun 1969, John Pierce yang berpengaruh menulis surat terbuka yang menjadi kritis dan defunded studi reputasi pidato. Defunding ini berlangsung sampai Pierce pensiun dan James L. Flanagan mengambil alih.
Raj Reddy menjadi orang pertama yang mengambil popularitas pidato tanpa henti sebagai sarjana pascasarjana di Stanford University pada akhir 1960-an. Sistem sebelumnya mengharuskan pelanggan untuk berhenti setelah setiap frasa. Mesin Reddy mengeluarkan perintah lisan untuk catur judi.
Sekitar waktu ini para peneliti Soviet menemukan seperangkat aturan warping waktu dinamis (DTW) dan menggunakannya untuk menciptakan seorang recognizer yang mampu mengerjakan kosakata 2000 frasa. DTW memproses pidato dengan membaginya menjadi bingkai cepat, misalnya segmen 10ms, dan memproses setiap tubuh sebagai unit yang belum menikah. Meskipun DTW mungkin digantikan oleh algoritma kemudian, pendekatan terus berlanjut. Mencapai independensi pembicara tetap tidak terpecahkan saat ini periode.1970-1990[edit]Tahun 1971 - DARPA mendanai lima tahun untuk Speech Understanding Research,studi reputasi pidato untuk mencari ukuran kosakata minimum satu.000 kata. Mereka pikir pemahaman berbicara mungkin rahasia untuk meaking perkembangan dalam reputasibicara, namun ini kemudian terbukti tidak benar. [enam belas] BBN, IBM, Carnegie Mellon dan Stanford Research Institute semuanya berpartisipasi dalam program ini. [17] [18] Penelitian pengenalan ucapan yang dihidupkan kembali ini memasang surat John Pierce.Tahun 1972 - Organisasi IEEE Acoustics, Speech, and Signal Processing mengadakan konferensi di Newton, Massachusetts.Tahun 1976 - ICASSP pertama diadakan di Philadelphia, yang karena faktanya kemudian telah menjadi tempat utama untuk buklet penelitian tentang popularitas pidato. [19]
Selama tahun 1960-an yang terlambat Leonard Baum memajukan aritmatika rantai Markov di Institute for Defense Analysis. Satu dekade kemudian, di CMU, mahasiswa Raj Reddy James Baker dan Janet M. Baker memulai penggunaan Hidden Markov Model (HMM) untuk reputasi bicara. James Baker telah menemukan sekitar HMM dari kegiatan musim panas di Institute of Defense Analysis selama pelatihan sarjananya. Penggunaan HMM memungkinkan para peneliti untuk mencampur sumber daya pemahaman yang unik, yang meliputi akustik, bahasa, dan sintaksis, dalam model probabilistik terpadu.Pada pertengahan 1980-an kru IBM Fred Jelinek menciptakan mesin tik diaktifkan suara yang disebut Tangora, yang dapat mengatasi kosakata 20.000 kata [22] Teknik statistik Jelinek menempatkan jauh lebih sedikit penekanan pada meniru cara taktik pikiran manusia dan memahami pidato lebih memilih penggunaan strategi pemodelan statistik seperti HMM. (kelompok Jelinek secara independen menemukan perangkat lunak HMM untuk berbicara. Ini menjadi bisa diperdebatkan dengan ahli bahasa mengingat HMM terlalu sederhana untuk menjelaskan banyak kemampuan biasa bahasa manusia. Namun, HMM terbukti menjadi cara yang sangat berguna untuk pemodelan pidato dan mengubah waktu dinamis warping untuk menjadi algoritma reputasi pidato dominan di tahun 1980-an. [24]Tahun 1982 - Dragon Systems, didirikan dengan menggunakan James dan Janet M. Baker, menjadi salah satu dari beberapa kompetisi IBM.Popularitas pidato praktis[edit]
Tahun 80-an juga melihat pembuatan versi bahasa n-gram.1987 - Versi yang dikembalikan memungkinkan mode bahasa untuk menerapkan beberapa durasi n-gram, dan CSELT menggunakan HMM untuk memahami bahasa (masing-masing dalam perangkat lunak dan dalam prosesor khusus perangkat keras, misalnya RIPAC).
Sebagian besar kemajuan dalam disiplin berutang pada bakat sistem komputer yang meningkat pesat. Pada berhentinya perangkat lunak DARPA pada tahun 1976, komputer yang menyenangkan yang tersedia untuk para peneliti menjadi PDP-10 dengan empat MB ram. [23] Butuh waktu hingga seratus menit untuk memecahkan kode hanya 30 detik pidato. [26]
Dua produk yang masuk akal adalah:Tahun 1984 - diluncurkan Apricot Portable dengan bantuan sebanyak 4096 kata, yang hanya enam puluh empat yang dapat disimpan dalam RAM pada suatu waktu. [27]1987 - seorang recognizer dari Kurzweil Applied IntelligenceTahun 1990 - Dragon Dictate, produk klien yang diluncurkan pada tahun 1990[28][29] AT&T mengerahkan operator Voice Recognition Call Processing pada tahun 1992 untuk merutekan panggilan ponsel tanpa menggunakan operator manusia. Generasi ini menjadi maju melalui Lawrence Rabiner dan lain-lain di Bell Labs.
Dengan faktor ini, kosakata gadget reputasi bicara bisnis standar menjadi lebih besar dari kosakata manusia umum. [23] Mantan murid Raj Reddy, Xuedong Huang, memajukan gadget Sphinx-II di CMU. Gadget Sphinx-II menjadi yang pertama melakukan kosakata yang tidak memihak pembicara, kosakata besar, popularitas bicara yang berkelanjutan dan memiliki kinerja terbaik dalam evaluasi DARPA tahun 1992. Menangani pidato tanpa henti dengan kosakata besar menjadi tonggak utama dalam sejarah reputasi bicara. Huang kemudian menemukan organisasi reputasi pidato di Microsoft pada tahun 1993. Mahasiswa Raj Reddy Kai-Fu Lee bergabung dengan Apple di mana, pada tahun 1992, ia membantu memperluas prototipe antarmuka pidato untuk komputer Apple yang disebut sebagai Casper.
Lernout &Hauspie, sebuah organisasi reputasi pidato yang berbasis di Belgia, mengakuisisi banyak bisnis lain, yang meliputi Kurzweil Applied Intelligence pada tahun 1997 dan Dragon Systems pada tahun 2000. Teknologi bicara L &H digunakan dalam mesin yang berjalan Di Windows XP. L &H menjadi pemimpin industri sampai skandal akuntansi disampaikan berhenti ke agensi pada tahun 2001. Teknologi pidato dari L&H dibeli melalui ScanSoft yang menjadi Nuance pada tahun 2005. Apple pada awal program perangkat lunak berlisensi dari Nuance untuk menawarkan fungsi popularitas pidato kepada asisten virtual sirinya. [31]2000-an[edit]
Posting Komentar