莫云翔  Yunxiang (Kevin) Mo

我是香港科技大学(HKUST)大二本科生,主修计算机科学数学电子工程(三主修),并辅以人工智能延伸主修(CGA: 4.1 / 4.3)。我有幸师从宋阳秋(Prof. Yangqiu Song)教授与郑天石(Dr. Tianshi Zheng)博士,在 HKUST KnowComp 课题组从事研究。

我的研究兴趣集中在大语言模型的推理能力,关注强化学习(Reinforcement Learning)测试时扩展(Test-Time Scaling) —— 即模型如何从反馈中学习,以及如何在推理阶段分配算力以获得更可靠的推理表现。

我正在积极寻找相关方向的研究合作或实习(internship)机会。如果您在相关方向工作并有合适的机会,欢迎通过邮件联系我。

🔥 最新动态

  • 2026.03: 🎉 DixitWorld 的扩展版被 ACL 2026 主会接收。[OpenReview]
  • 2026.01: 🎉 ScaleCUAICLR 2026 接收为 Oral。[arXiv]
  • 2025.10: 🎉 DixitWorld 获得 EMNLP 2025 Workshop(BlackBox NLP)Spotlight。[arXiv]

💼 经历

2026.04 – 至今 | 研究实习生,Stanford HAI,美国斯坦福

吴方(Dr. Fang Wu) 博士指导,在 Yejin Choi 教授与 Jure Leskovec 教授的课题组。

2025.04 – 至今 | 本科研究员,HKUST KnowComp 课题组,中国香港特区

郑天石(Dr. Tianshi Zheng) 博士指导,在 宋阳秋(Prof. Yangqiu Song) 教授的课题组。

2025.06 – 2025.08 | 机器学习工程师实习生,北京君正集成电路股份有限公司,中国北京

面向嵌入式与片上 AI 场景开发和优化机器学习模型;使用 PyTorch 搭建模型训练、评估与推理流水线;在严格的延迟与内存约束下将模型部署至边缘设备。

2025.01 | 实习生,基准方中(Benchmark Architectural Design Co., Ltd.)

使用 MFC 框架开发小程序项目的前端模块;参与 UI 设计、事件处理与系统调试。

📚 论文发表

Robust Decision-Making for LLM Agents in Multi-Turn Reasoning

在投

LLM 智能体在多轮推理中常常陷入自锁循环 —— 由于近似的信念追踪,模型反复回到相同假设而无法取得认知进展。我们形式化了这类循环出现的结构性条件,并指出该失败模式即便对前沿模型、即便采用标准的信息获取目标依然存在。为此,我们提出一种免训练、分布鲁棒的信息增益目标,显式对信念追踪误差进行对冲,从而在无需微调的情况下恢复探索性进展。该方法在多轮推理、规划与决策等多个基准上进行了评测,涵盖开源与闭源 LLM 智能体。

AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era

Yunxiang Mo, Tianshi Zheng, Yisen Gao, Rui Wang, Newt Nguyen Kim Hue Nam, Kelvin Kiu Wai Tam, Jiaxin Bai, Yangqiu Song, Ginny Wong, Simon See.

在投

面向科学构想(scientific ideation)的多学科基准,在"静态观察"与"主动探索"两种对齐设置下评测模型,覆盖五大学科、40 个密集打分的子领域,并采用文献可验证的评分框架 —— 由 critic 对照检索到的已有工作判定原创性。结果显示主动探索暴露出明显更大的能力上限,其增长速度约为静态观察的两倍,且该收益具有"能力门槛":越强的模型收益越大。

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song.

ACL 2026

下方 workshop 版本的扩展版 —— 新增 Medium 难度档(252 vs 168 道 QA),72B 参数规模消融,以及 calibration / sensitivity 分析。

ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data

Zhaoyang Liu, Jingjing Xie, Zichen Ding, Zehao Li, Bowen Yang, Zhenyu Wu, Xuehui Wang, Qiushi Sun, Shi Liu, Weiyun Wang, Shenglong Ye, Qingyun Li, Xuan Dong, Yue Yu, Chenyu Lu, Yunxiang Mo, Yao Yan, Zeyue Tian, Xiao Zhang, Yuan Huang, Yiqian Liu, Weijie Su, Gen Luo, Xiangyu Yue, Biqing Qi, Kai Chen, Bowen Zhou, Yu Qiao, Qifeng Chen, Wenhai Wang.

ICLR 2026 Oral

我的贡献:开源代码库中的数据流水线与跨平台 workflow 组件。

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song.

EMNLP 2025 Workshop Spotlight

Workshop 原始版本;扩展版被 ACL 2026 主会接收(见上)。

🛠️ 项目

Facere — AI 原生硬件设计 Agent

端到端硬件设计 CLI —— 原理图、PCB 布线与物理仿真。

与 Yiping Zhao、Jiahao Zhang、Zichen Lin 合作。独立开发。

一个 terminal-native 的 agent,与 KiCad 9 协作绘制和编辑原理图与 PCB 布线。我们构建了一个 hardware-aware 的 MCP server,后端为一套精心整理的 153 模板原理图语料库,并配备独立的 PCB 物理仿真包,使 agent 能够端到端规划、编辑并验证设计。通过单条命令的 bootstrap 安装器分发。

PastPaper Master — AI 真题辅导工具

辅助 HKUST 学生练习历年真题的 Web 应用。

与 Yiping Zhao 和 Jiahao Zhang 合作。独立开发。

为 HKUST 学生准备真题的全栈 AI 辅导工具。GPT-4o 自动从上传的 PDF 中切分并标注每一道题;Qwen-plus 为每道题生成知识点回顾、阶梯式提示与分步解答。工作台支持左右双栏 PDF↔题目联动、拍照手写答题 OCR 批改、相似变体题自动生成,以及带遗忘曲线复习的错题本。

🏆 荣誉与奖项

  • University’s Scholarship Scheme for Continuing Undergraduate Students(在校生奖学金计划),HKUST,2024。在校生前 1%。
  • S.S. Chern Class(陈省身班),HKUST。表彰所有数学课程上的顶尖学术表现。
  • Dean’s List Honor(院长嘉许),HKUST,2024 & 2025。GPA 高于 3.7。

🤝 学术服务

(更新中。)

🎓 教学

  • 课程助教,Discrete Mathematics(离散数学) —— HKUST。
  • 课程助教,Exploring Artificial Intelligence(探索人工智能) —— HKUST。