Towards Machine Speech-to-speech Translation

Nakamura, Satoshi; Sudoh, Katsuhito; Sakti, Sakriani

Towards Machine Speech-to-speech Translation

dc.contributor.author

Nakamura, Satoshi

dc.contributor.author

Sudoh, Katsuhito

dc.contributor.author

Sakti, Sakriani

dc.date.issued

2019

dc.identifier

https://ddd.uab.cat/record/216446

dc.identifier

urn:10.5565/rev/tradumatica.238

dc.identifier

urn:oai:ddd.uab.cat:216446

dc.identifier

urn:oai:tradumatica.revistes.uab.cat:article/238

dc.identifier

urn:articleid:15787559n17p81

dc.identifier

urn:wos_id:000508844200006

dc.identifier

urn:altmetric_id:73976720

dc.identifier

urn:scopus_id:85079695256

dc.identifier

urn:oai:raco.cat:article/363950

dc.description.abstract

There has been a good deal of research on machine speech-to-speech translation (S2ST) in Japan, and this article presents these and our own recent research on automatic simultaneous speech translation. The S2ST system is basically composed of three modules: large vocabulary continuous automatic speech recognition (ASR), machine text-to-text translation (MT) and text-to-speech synthesis (TTS). All these modules need to be multilingual in nature and thus require multilingual speech and corpora for training models. S2ST performance is drastically improved by deep learning and large training corpora, but many issues still still remain such as simultaneity, paralinguistics, context and situation dependency, intention and cultural dependency. This article presents current on-going research and discusses issues with a view to next-generation speech-to-speech translation.

dc.description.abstract

En Japón se han llevado a cabo muchas actividades de investigación acerca de la traducción automática del habla. Este artículo pretende ofrecer una visión general de dichas actividades y presentar las que se han realizado más recientemente. El sistema S2ST está formado básicamente por tres módulos: el reconocimiento automático del habla continua y de amplios vocabularios (Automatic Speech Recognition, ASR), la traducción automática de textos (Machine translation, MT) y la conversión de texto a voz (Text-to-Speech Synthesis, TTS). Todos los módulos deben ser plurilingües, por lo cual se requieren discursos y corpus multilingües para los modelos de formación. El rendimiento del sistema S2ST mejora considerablemente por medio de un aprendizaje profundo y grandes corpus formativos. Sin embargo, todavía hace falta tratar diversos aspectos, com la simultaneidad, la paralingüística, la dependencia del contexto y de la situación, la intención y la dependencia cultural. Por todo ello, repasaremos las actividades de investigación actuales y discutiremos varias cuestiones relacionadas con la traducción automática del habla de última generación.

dc.description.abstract

Al Japó s'han dut a terme moltes activitats de recerca sobre la traducció automàtica de la parla. Aquest article n'ofereix una visió general i presenta les activitats que s'han efectuat més recentment. El sistema S2ST es compon bàsicament de tres mòduls: el reconeixement automàtic de la parla contínua i de vocabularis extensos (Automatic Speech Recognition, ASR), la traducció automàtica de textos (Machine translation, MT) i la conversió de text a veu (Text-to-Speech Synthesis, TTS). Tots els mòduls han de ser plurilingües, per la qual cosa es requereixen discursos i corpus multilingües per als models de formació. El rendiment del sistema S2ST millora considerablement per mitjà d'un aprenentatge profund i de grans corpus formatius. Tanmateix, encara cal tractar diversos aspectes, com la simultaneïtat, la paralingüística, la dependència del context i de la situació, la intenció i la dependència cultural. Així, farem un repàs a les activitats de recerca actuals i discutirem diverses qüestions relacionades amb la traducció automàtica de la parla d'última generació.

dc.format

application/pdf

dc.language

eng

dc.publisher

dc.relation

;

dc.relation

Tradumàtica ; Núm. 17 (2019), p. 81-87

dc.rights

open access

dc.rights

Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, la comunicació pública de l'obra i la creació d'obres derivades, fins i tot amb finalitats comercials, sempre i quan es reconegui l'autoria de l'obra original.

dc.rights

https://creativecommons.org/licenses/by/4.0/

dc.subject

Speech-to-speech translation

dc.subject

Automatic speech recognition

dc.subject

Machine text-to-text translation

dc.subject

Text-to-speech synthesis

dc.subject

Traducción automática del habla

dc.subject

Reconocimiento automático del habla

dc.subject

Traducción automática de textos

dc.subject

Conversión de texto a voz

dc.subject

Traducció automàtica de la parla

dc.subject

Reconeixement automàtic de la parla

dc.subject

Traducció automàtica de textos

dc.subject

Conversió de text a veu

dc.title

Towards Machine Speech-to-speech Translation

dc.type

Article

Files in this item

Files	Size	Format	View
There are no files associated with this item.

This item appears in the following Collection(s)

Articles escrits per personal UAB o publicats per la universitat [88071]