Search Results for author: Hieu Tran

Found 22 papers, 14 papers with code

Distillation Contrastive Decoding: Improving LLMs Reasoning with Contrastive Decoding and Distillation

1 code implementation • 21 Feb 2024 • Phuc Phan, Hieu Tran, Long Phan

We propose a straightforward approach called Distillation Contrastive Decoding (DCD) to enhance the reasoning capabilities of Large Language Models (LLMs) during inference.

Arithmetic Reasoning GSM8K +3

Paper
Code

README: Bridging Medical Jargon and Lay Understanding for Patient Education through Data-Centric NLP

1 code implementation • 24 Dec 2023 • Zonghai Yao, Nandyala Siddharth Kantu, Guanghao Wei, Hieu Tran, Zhangqi Duan, Sunjae Kwon, Zhichao Yang, README annotation team, Hong Yu

The advancement in healthcare has shifted focus toward patient-centric approaches, particularly in self-care and patient education, facilitated by access to Electronic Health Records (EHR).

Paper
Code

BioInstruct: Instruction Tuning of Large Language Models for Biomedical Natural Language Processing

no code implementations • 30 Oct 2023 • Hieu Tran, Zhichao Yang, Zonghai Yao, Hong Yu

We also examined whether categories(e. g., QA, IE, and generation) of instructions impact model performance.

Language Modelling Multi-Task Learning +2

Paper
Add Code

The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset

no code implementations • 7 Mar 2023 • Hugo Laurençon, Lucile Saulnier, Thomas Wang, Christopher Akiki, Albert Villanova del Moral, Teven Le Scao, Leandro von Werra, Chenghao Mou, Eduardo González Ponferrada, Huu Nguyen, Jörg Frohberg, Mario Šaško, Quentin Lhoest, Angelina McMillan-Major, Gerard Dupont, Stella Biderman, Anna Rogers, Loubna Ben allal, Francesco De Toni, Giada Pistilli, Olivier Nguyen, Somaieh Nikpoor, Maraim Masoud, Pierre Colombo, Javier de la Rosa, Paulo Villegas, Tristan Thrush, Shayne Longpre, Sebastian Nagel, Leon Weber, Manuel Muñoz, Jian Zhu, Daniel van Strien, Zaid Alyafeai, Khalid Almubarak, Minh Chien Vu, Itziar Gonzalez-Dios, Aitor Soroa, Kyle Lo, Manan Dey, Pedro Ortiz Suarez, Aaron Gokaslan, Shamik Bose, David Adelani, Long Phan, Hieu Tran, Ian Yu, Suhas Pai, Jenny Chim, Violette Lepercq, Suzana Ilic, Margaret Mitchell, Sasha Alexandra Luccioni, Yacine Jernite

As language models grow ever larger, the need for large-scale high-quality text datasets has never been more pressing, especially in multilingual settings.

Ethics Language Modelling

Paper
Add Code

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

6 code implementations • 9 Nov 2022 • BigScience Workshop, :, Teven Le Scao, Angela Fan, Christopher Akiki, Ellie Pavlick, Suzana Ilić, Daniel Hesslow, Roman Castagné, Alexandra Sasha Luccioni, François Yvon, Matthias Gallé, Jonathan Tow, Alexander M. Rush, Stella Biderman, Albert Webson, Pawan Sasanka Ammanamanchi, Thomas Wang, Benoît Sagot, Niklas Muennighoff, Albert Villanova del Moral, Olatunji Ruwase, Rachel Bawden, Stas Bekman, Angelina McMillan-Major, Iz Beltagy, Huu Nguyen, Lucile Saulnier, Samson Tan, Pedro Ortiz Suarez, Victor Sanh, Hugo Laurençon, Yacine Jernite, Julien Launay, Margaret Mitchell, Colin Raffel, Aaron Gokaslan, Adi Simhi, Aitor Soroa, Alham Fikri Aji, Amit Alfassy, Anna Rogers, Ariel Kreisberg Nitzav, Canwen Xu, Chenghao Mou, Chris Emezue, Christopher Klamm, Colin Leong, Daniel van Strien, David Ifeoluwa Adelani, Dragomir Radev, Eduardo González Ponferrada, Efrat Levkovizh, Ethan Kim, Eyal Bar Natan, Francesco De Toni, Gérard Dupont, Germán Kruszewski, Giada Pistilli, Hady Elsahar, Hamza Benyamina, Hieu Tran, Ian Yu, Idris Abdulmumin, Isaac Johnson, Itziar Gonzalez-Dios, Javier de la Rosa, Jenny Chim, Jesse Dodge, Jian Zhu, Jonathan Chang, Jörg Frohberg, Joseph Tobing, Joydeep Bhattacharjee, Khalid Almubarak, Kimbo Chen, Kyle Lo, Leandro von Werra, Leon Weber, Long Phan, Loubna Ben allal, Ludovic Tanguy, Manan Dey, Manuel Romero Muñoz, Maraim Masoud, María Grandury, Mario Šaško, Max Huang, Maximin Coavoux, Mayank Singh, Mike Tian-Jian Jiang, Minh Chien Vu, Mohammad A. Jauhar, Mustafa Ghaleb, Nishant Subramani, Nora Kassner, Nurulaqilla Khamis, Olivier Nguyen, Omar Espejel, Ona de Gibert, Paulo Villegas, Peter Henderson, Pierre Colombo, Priscilla Amuok, Quentin Lhoest, Rheza Harliman, Rishi Bommasani, Roberto Luis López, Rui Ribeiro, Salomey Osei, Sampo Pyysalo, Sebastian Nagel, Shamik Bose, Shamsuddeen Hassan Muhammad, Shanya Sharma, Shayne Longpre, Somaieh Nikpoor, Stanislav Silberberg, Suhas Pai, Sydney Zink, Tiago Timponi Torrent, Timo Schick, Tristan Thrush, Valentin Danchev, Vassilina Nikoulina, Veronika Laippala, Violette Lepercq, Vrinda Prabhu, Zaid Alyafeai, Zeerak Talat, Arun Raja, Benjamin Heinzerling, Chenglei Si, Davut Emre Taşar, Elizabeth Salesky, Sabrina J. Mielke, Wilson Y. Lee, Abheesht Sharma, Andrea Santilli, Antoine Chaffin, Arnaud Stiegler, Debajyoti Datta, Eliza Szczechla, Gunjan Chhablani, Han Wang, Harshit Pandey, Hendrik Strobelt, Jason Alan Fries, Jos Rozen, Leo Gao, Lintang Sutawika, M Saiful Bari, Maged S. Al-shaibani, Matteo Manica, Nihal Nayak, Ryan Teehan, Samuel Albanie, Sheng Shen, Srulik Ben-David, Stephen H. Bach, Taewoon Kim, Tali Bers, Thibault Fevry, Trishala Neeraj, Urmish Thakker, Vikas Raunak, Xiangru Tang, Zheng-Xin Yong, Zhiqing Sun, Shaked Brody, Yallow Uri, Hadar Tojarieh, Adam Roberts, Hyung Won Chung, Jaesung Tae, Jason Phang, Ofir Press, Conglong Li, Deepak Narayanan, Hatim Bourfoune, Jared Casper, Jeff Rasley, Max Ryabinin, Mayank Mishra, Minjia Zhang, Mohammad Shoeybi, Myriam Peyrounette, Nicolas Patry, Nouamane Tazi, Omar Sanseviero, Patrick von Platen, Pierre Cornette, Pierre François Lavallée, Rémi Lacroix, Samyam Rajbhandari, Sanchit Gandhi, Shaden Smith, Stéphane Requena, Suraj Patil, Tim Dettmers, Ahmed Baruwa, Amanpreet Singh, Anastasia Cheveleva, Anne-Laure Ligozat, Arjun Subramonian, Aurélie Névéol, Charles Lovering, Dan Garrette, Deepak Tunuguntla, Ehud Reiter, Ekaterina Taktasheva, Ekaterina Voloshina, Eli Bogdanov, Genta Indra Winata, Hailey Schoelkopf, Jan-Christoph Kalo, Jekaterina Novikova, Jessica Zosa Forde, Jordan Clive, Jungo Kasai, Ken Kawamura, Liam Hazan, Marine Carpuat, Miruna Clinciu, Najoung Kim, Newton Cheng, Oleg Serikov, Omer Antverg, Oskar van der Wal, Rui Zhang, Ruochen Zhang, Sebastian Gehrmann, Shachar Mirkin, Shani Pais, Tatiana Shavrina, Thomas Scialom, Tian Yun, Tomasz Limisiewicz, Verena Rieser, Vitaly Protasov, Vladislav Mikhailov, Yada Pruksachatkun, Yonatan Belinkov, Zachary Bamberger, Zdeněk Kasner, Alice Rueda, Amanda Pestana, Amir Feizpour, Ammar Khan, Amy Faranak, Ana Santos, Anthony Hevia, Antigona Unldreaj, Arash Aghagol, Arezoo Abdollahi, Aycha Tammour, Azadeh HajiHosseini, Bahareh Behroozi, Benjamin Ajibade, Bharat Saxena, Carlos Muñoz Ferrandis, Daniel McDuff, Danish Contractor, David Lansky, Davis David, Douwe Kiela, Duong A. Nguyen, Edward Tan, Emi Baylor, Ezinwanne Ozoani, Fatima Mirza, Frankline Ononiwu, Habib Rezanejad, Hessie Jones, Indrani Bhattacharya, Irene Solaiman, Irina Sedenko, Isar Nejadgholi, Jesse Passmore, Josh Seltzer, Julio Bonis Sanz, Livia Dutra, Mairon Samagaio, Maraim Elbadri, Margot Mieskes, Marissa Gerchick, Martha Akinlolu, Michael McKenna, Mike Qiu, Muhammed Ghauri, Mykola Burynok, Nafis Abrar, Nazneen Rajani, Nour Elkott, Nour Fahmy, Olanrewaju Samuel, Ran An, Rasmus Kromann, Ryan Hao, Samira Alizadeh, Sarmad Shubber, Silas Wang, Sourav Roy, Sylvain Viguier, Thanh Le, Tobi Oyebade, Trieu Le, Yoyo Yang, Zach Nguyen, Abhinav Ramesh Kashyap, Alfredo Palasciano, Alison Callahan, Anima Shukla, Antonio Miranda-Escalada, Ayush Singh, Benjamin Beilharz, Bo wang, Caio Brito, Chenxi Zhou, Chirag Jain, Chuxin Xu, Clémentine Fourrier, Daniel León Periñán, Daniel Molano, Dian Yu, Enrique Manjavacas, Fabio Barth, Florian Fuhrimann, Gabriel Altay, Giyaseddin Bayrak, Gully Burns, Helena U. Vrabec, Imane Bello, Ishani Dash, Jihyun Kang, John Giorgi, Jonas Golde, Jose David Posada, Karthik Rangasai Sivaraman, Lokesh Bulchandani, Lu Liu, Luisa Shinzato, Madeleine Hahn de Bykhovetz, Maiko Takeuchi, Marc Pàmies, Maria A Castillo, Marianna Nezhurina, Mario Sänger, Matthias Samwald, Michael Cullan, Michael Weinberg, Michiel De Wolf, Mina Mihaljcic, Minna Liu, Moritz Freidank, Myungsun Kang, Natasha Seelam, Nathan Dahlberg, Nicholas Michio Broad, Nikolaus Muellner, Pascale Fung, Patrick Haller, Ramya Chandrasekhar, Renata Eisenberg, Robert Martin, Rodrigo Canalli, Rosaline Su, Ruisi Su, Samuel Cahyawijaya, Samuele Garda, Shlok S Deshmukh, Shubhanshu Mishra, Sid Kiblawi, Simon Ott, Sinee Sang-aroonsiri, Srishti Kumar, Stefan Schweter, Sushil Bharati, Tanmay Laud, Théo Gigant, Tomoya Kainuma, Wojciech Kusa, Yanis Labrak, Yash Shailesh Bajaj, Yash Venkatraman, Yifan Xu, Yingxin Xu, Yu Xu, Zhe Tan, Zhongli Xie, Zifan Ye, Mathilde Bras, Younes Belkada, Thomas Wolf

Large language models (LLMs) have been shown to be able to perform new tasks based on a few demonstrations or natural language instructions.

Language Modelling Multilingual NLP

2,196

Paper
Code

MTet: Multi-domain Translation for English and Vietnamese

2 code implementations • 11 Oct 2022 • Chinh Ngo, Trieu H. Trinh, Long Phan, Hieu Tran, Tai Dang, Hieu Nguyen, Minh Nguyen, Minh-Thang Luong

We introduce MTet, the largest publicly available parallel corpus for English-Vietnamese translation.

Ranked #1 on Machine Translation on IWSLT2015 English-Vietnamese (using extra training data)

Machine Translation +2

170

Paper
Code

Enriching Biomedical Knowledge for Low-resource Language Through Large-Scale Translation

1 code implementation • 11 Oct 2022 • Long Phan, Tai Dang, Hieu Tran, Trieu H. Trinh, Vy Phan, Lam D. Chau, Minh-Thang Luong

Biomedical data and benchmarks are highly valuable yet very limited in low-resource languages other than English such as Vietnamese.

Translation

Paper
Code

TLETA: Deep Transfer Learning and Integrated Cellular Knowledge for Estimated Time of Arrival Prediction

no code implementations • 17 Jun 2022 • Hieu Tran, Son Nguyen, I-Ling Yen, Farokh Bastani

Importantly, our transfer models only train the last layers to map the transferred knowledge, that reduces the training time significantly.

Transfer Learning

Paper
Add Code

ViT5: Pretrained Text-to-Text Transformer for Vietnamese Language Generation

1 code implementation • NAACL (ACL) 2022 • Long Phan, Hieu Tran, Hieu Nguyen, Trieu H. Trinh

In this work, we perform exhaustive experiments on both Vietnamese Abstractive Summarization and Named Entity Recognition, validating the performance of ViT5 against many other pretrained Transformer-based encoder-decoder models.

Ranked #1 on Named Entity Recognition In Vietnamese on PhoNER COVID19

Abstractive Text Summarization named-entity-recognition +3

Paper
Code

IoT Data Discovery: Routing Table and Summarization Techniques

no code implementations • 21 Mar 2022 • Hieu Tran, Son Nguyen, I-Ling Yen, Farokh Bastani

Specifically, as the first in the field, this paper investigates routing table designs and various compression techniques to support effective and space-efficient IoT data discovery routing.

Paper
Add Code

MTet: Multi-domain Translation for English-Vietnamese

1 code implementation • Blog 2022 • Chinh Ngo, Hieu Tran, Long Phan, Trieu H. Trinh, Hieu Nguyen, Minh Nguyen, Minh-Thang Luong

We are excited to introduce a new larger and better quality Machine Translation dataset, MTet, which stands for Multi-domain Translation for English and VieTnamese.

Machine Translation Sentence +1

170

Paper
Code

Transfer Reinforcement Learning for Differing Action Spaces via Q-Network Representations

1 code implementation • 5 Feb 2022 • Nathan Beck, Abhiramon Rajasekharan, Hieu Tran

In this paper, we approach the task of transfer learning between domains that differ in action spaces.

Acrobot reinforcement-learning +2

Paper
Code

VieSum: How Robust Are Transformer-based Models on Vietnamese Summarization?

no code implementations • 8 Oct 2021 • Hieu Nguyen, Long Phan, James Anibal, Alec Peltekian, Hieu Tran

Text summarization is a challenging task within natural language processing that involves text generation from lengthy input sequences.

Abstractive Text Summarization Self-Supervised Learning +3

Paper
Add Code

Into Summarization Techniques for IoT Data Discovery Routing

1 code implementation • 20 Jul 2021 • Hieu Tran, Son Nguyen, I-Ling Yen, Farokh Bastani

Also, our approach outperforms DHT based approaches by 2 to 6 folds in terms of latency and traffic.

Paper
Code

An Efficient Transformer-Based Model for Vietnamese Punctuation Prediction

1 code implementation • IEA/AIE 2021 • Hieu Tran, Cuong V. Dinh, Quang Pham, Binh T. Nguyen

In both formal and informal texts, missing punctuation marks make the texts confusing and challenging to read.

Paper
Code

SPBERT: An Efficient Pre-training BERT on SPARQL Queries for Question Answering over Knowledge Graphs

1 code implementation • 18 Jun 2021 • Hieu Tran, Long Phan, James Anibal, Binh T. Nguyen, Truong-Son Nguyen

In this paper, we propose SPBERT, a transformer-based language model pre-trained on massive SPARQL query logs.

Knowledge Graphs Language Modelling +2

Paper
Code

SciFive: a text-to-text transformer model for biomedical literature

1 code implementation • 28 May 2021 • Long N. Phan, James T. Anibal, Hieu Tran, Shaurya Chanana, Erol Bahadroglu, Alec Peltekian, Grégoire Altan-Bonnet

In this report, we introduce SciFive, a domain-specific T5 model that has been pre-trained on large biomedical corpora.

Ranked #1 on Natural Language Inference on MedNLI

Document Classification Drug–drug Interaction Extraction +6

Paper
Code

Hierarchical Transformer Encoders for Vietnamese Spelling Correction

1 code implementation • 28 May 2021 • Hieu Tran, Cuong V. Dinh, Long Phan, Son T. Nguyen

We compare our method with other methods and publicly available systems.

Spelling Correction

Paper
Code

CoTexT: Multi-task Learning with Code-Text Transformer

1 code implementation • ACL (NLP4Prog) 2021 • Long Phan, Hieu Tran, Daniel Le, Hieu Nguyen, James Anibal, Alec Peltekian, Yanfang Ye

We train CoTexT on different combinations of available PL corpus including both "bimodal" and "unimodal" data.

Code Generation Code Summarization +3

Paper
Code

Does BLEU Score Work for Code Migration?

no code implementations • 12 Jun 2019 • Ngoc Tran, Hieu Tran, Son Nguyen, Hoan Nguyen, Tien N. Nguyen

In this paper, we conducted an empirical study on BLEU score to (in)validate its suitability for the code migration task due to its inability to reflect the semantics of source code.

Machine Translation Translation

Paper
Add Code

Recovering Variable Names for Minified Code with Usage Contexts

no code implementations • 8 Jun 2019 • Hieu Tran, Ngoc Tran, Son Nguyen, Hoan Nguyen, Tien Nguyen

JSNeat follows a data-driven approach to recover names by searching for them in a large corpus of open-source JS code.

Information Retrieval Retrieval

Paper
Add Code

Detection and Prediction of Users Attitude Based on Real-Time and Batch Sentiment Analysis of Facebook Comments

no code implementations • 8 Jun 2019 • Hieu Tran, Maxim Shcherbakov

However, it is important to know the position of a certain user on posts even though the opinion is negative.

Avg Clustering +2

Paper
Add Code

Cannot find the paper you are looking for? You can Submit a new open access paper.