Search Results for author: Xiaoying Jia

Found 3 papers, 3 papers with code

MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs

1 code implementation • 23 Feb 2024 • Ziheng Jiang, Haibin Lin, Yinmin Zhong, Qi Huang, Yangrui Chen, Zhi Zhang, Yanghua Peng, Xiang Li, Cong Xie, Shibiao Nong, Yulu Jia, Sun He, Hongmin Chen, Zhihao Bai, Qi Hou, Shipeng Yan, Ding Zhou, Yiyao Sheng, Zhuo Jiang, Haohan Xu, Haoran Wei, Zhang Zhang, Pengfei Nie, Leqi Zou, Sida Zhao, Liang Xiang, Zherui Liu, Zhe Li, Xiaoying Jia, Jianxi Ye, Xin Jin, Xin Liu

Training LLMs at this scale brings unprecedented challenges to training efficiency and stability.

Language Modelling Large Language Model

371

Paper
Code

ByteTransformer: A High-Performance Transformer Boosted for Variable-Length Inputs

1 code implementation • 6 Oct 2022 • Yujia Zhai, Chengquan Jiang, Leyuan Wang, Xiaoying Jia, Shang Zhang, Zizhong Chen, Xin Liu, Yibo Zhu

In this paper, we present ByteTransformer, a high-performance transformer boosted for variable-length inputs.

Vocal Bursts Intensity Prediction

428

Paper
Code

Accelerating Sparse DNN Models without Hardware-Support via Tile-Wise Sparsity

1 code implementation • 29 Aug 2020 • Cong Guo, Bo Yang Hsueh, Jingwen Leng, Yuxian Qiu, Yue Guan, Zehuan Wang, Xiaoying Jia, Xipeng Li, Minyi Guo, Yuhao Zhu

Network pruning can reduce the high computation cost of deep neural network (DNN) models.

Network Pruning

140

Paper
Code

Cannot find the paper you are looking for? You can Submit a new open access paper.