An Empirical Analysis of Data Selection Techniques in Statistical Machine Translation

dc.contributor.affiliationCentro de Investigación Pattern Recognition and Human Language Technology
dc.contributor.authorChinea Ríos, Maraes_ES
dc.contributor.authorSanchis Trilles, Germánes_ES
dc.contributor.authorCasacuberta Nolla, Francisco
dc.contributor.funderEuropean Commission
dc.contributor.funderGeneralitat Valenciana
dc.date.accessioned2016-05-17T11:42:50Z
dc.date.available2016-05-17T11:42:50Z
dc.date.issued2015-09
dc.description.abstract[EN] Domain adaptation has recently gained interest in statistical machine translation. One of the adaptation techniques is based in the selection data. Data selection aims to select the best subset of the bilingual sentences from an available pool of sentences, with which to train a SMT system. In this paper, we study how affect the bilingual corpora used for the data selection methods in the translation qualityen_EN
dc.description.abstract[ES] La adaptación de dominios genera mucho interés dentro de la traducción automática estadística. Una de las técnicas de adaptaciión esta basada en la selecciión de datos que tiene como objetivo seleccionar el mejor subconjunto de oraciones bilingües de un gran conjunto de oraciones. En este artículo estudiamos como afectan los corpus bilingües empleados por los métodos de selección de frases en la calidad de las traducciones.es_ES
dc.description.accrualMethodSes_ES
dc.description.bibliographicCitationChinea Ríos, M.; Sanchis Trilles, G.; Casacuberta Nolla, F. (2015). An Empirical Analysis of Data Selection Techniques in Statistical Machine Translation. Procesamiento del Lenguaje Natural. (55):101-108. https://riunet.upv.es/handle/10251/64250es_ES
dc.description.issue55es_ES
dc.description.sponsorshipThe research leading to these results has received funding from the European Union Seventh Framework Programme (FP7/2007-2013) under grant agreement No. 287576 (CasMaCat). Also funded by the Generalitat Valenciana under grant Prometeo/2009/014.
dc.description.upvformatpfin108es_ES
dc.description.upvformatpinicio101es_ES
dc.identifier.issn1135-5948
dc.identifier.urihttps://riunet.upv.es/handle/10251/64250
dc.languageIngléses_ES
dc.publisherSociedad Española para el Procesamiento del Lenguaje Natural (SEPLN)es_ES
dc.relation.ispartofProcesamiento del Lenguaje Naturales_ES
dc.relation.projectIDinfo:eu-repo/grantAgreement/GVA//PROMETEO09%2F2009%2F014/ES/Adaptive learning and multimodality in pattern recognition (Almapater)/es_ES
dc.relation.projectIDinfo:eu-repo/grantAgreement/EC/FP7/287576/EU/Cognitive Analysis and Statistical Methods for Advanced Computer Aided Translation/es_ES
dc.relation.publisherversionhttp://journal.sepln.org/sepln/ojs/ojs/index.php/pln/issue/view/215es_ES
dc.relation.senia293283es_ES
dc.rightsReserva de todos los derechoses_ES
dc.rights.accessRightsAbiertoes_ES
dc.subjectStatistical machine translation, domain adaptation, bilingual sentence selection, infrequent n-gram, cross-entropyes_ES
dc.subjectStatistical machine translationes_ES
dc.subjectDomain adaptationes_ES
dc.subjectBilingual sentence selectiones_ES
dc.subjectInfrequent n-grames_ES
dc.subjectCross-entropyes_ES
dc.subjectTraducción automática estadísticaes_ES
dc.subjectAdaptación dominioses_ES
dc.subjectSelección de frases bilingüeses_ES
dc.subjectn-gramas infrecuenteses_ES
dc.subjectEntropía cruzadaes_ES
dc.subject.classificationLENGUAJES Y SISTEMAS INFORMATICOSes_ES
dc.titleAn Empirical Analysis of Data Selection Techniques in Statistical Machine Translationes_ES
dc.title.alternativeAnálisis empírico de técnicas de selección de datos en traducción automática estadística
dc.typeArtículoes_ES
dc.type.versioninfo:eu-repo/semantics/publishedVersiones_ES
dspace.entity.typePublication
person.identifier425
person.identifier.orcid0000-0002-8497-5598
relation.isAuthorOfPublicationf2173382-e788-4b13-9559-0e3310f743ec
relation.isAuthorOfPublication.latestForDiscoveryf2173382-e788-4b13-9559-0e3310f743ec
relation.isOrgUnitOfPublication67c70cf8-06ea-418a-a880-ac518c952be9
relation.isOrgUnitOfPublication.latestForDiscovery67c70cf8-06ea-418a-a880-ac518c952be9
upv.uuidc4441fc2-adef-49b4-bb54-78bddbe29b0fes_ES

Archivos

Bloque original

Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
-MARA;Sanchis;Casacuberta - An Empirical Analysis of Data Selection Techniques in Statistical Mach....pdf
Tamaño:
751.9 KB
Formato:
Adobe Portable Document Format
Descripción:
Versión editorial