我是詹佳博(Jiabo Zhan),即将于清华大学攻读计算机技术硕士学位,导师为袁春教授。我于 2026 年获得北京航空航天大学软件工程学士学位,本科期间以 GPA 3.873/4.0、专业排名 2/172(前 1.2%)毕业。

我的研究兴趣包括计算机视觉多模态大模型(MLLM)强化学习生成式人工智能(AIGC)文档智能。近期工作主要围绕透明及分层 RGBA 图像生成、高效文档解析、多模态数据构建与评测展开。

我的论文目前已获得 14 次 Google Scholar 引用,引用数据每日自动更新。Google Scholar 引用数

联系方式
微信:_Marsquakes

🔥 最新动态

  • 2026.09:  WeVisDoc 技术报告发布,面向鲁棒端到端文档解析,代码与 2B/4B 模型权重已开源。
  • 2026.08:  PaDoc 正式发布,代码与模型权重已开源。
  • 2026.08:  🎉 OmniAlpha 被 ACM Multimedia 2026(ACM MM 2026)录用,并入选 Oral Presentation(口头报告)!
  • 2026.04:  OmniAlpha 完成重要更新,引入面向透明感知生成的多任务强化学习。
  • 2025.11:  OmniAlpha 正式发布,代码与模型权重已开源。
  • 2025.07:  AlphaVAE 正式发布,代码、数据与模型已开源。

📝 论文

ACM MM 2026ORAL
OmniAlpha 示例

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

Hao Yu*, Jinglin Wang*, Jiabo Zhan*, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

* 共同一作。ACM Multimedia 2026。 ORAL PRESENTATION

论文 / PDF / 代码 / 模型 / Scholar

  • 统一处理图像抠图、目标移除、图层分解和 RGBA 生成等透明感知生成与编辑任务。
  • 个人贡献:参与多任务数据 schema 与评测流程设计、训练数据构建与治理,以及多任务 SFT 和 GRPO 风格强化学习后训练;在图层分解任务上实现 RGB L1 相对降低 9.07%。

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

Hao Yu*, Jiabo Zhan*, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

* 共同一作。

论文 / PDF / 代码 / 模型 / Scholar

  • 提出布局驱动的文档解析器,让各区域内容从共享的整页前缀并行分支;相较同骨干串行解码方案,吞吐提升 67.4–118%,同时保持领先的解析质量。

AlphaVAE: Unified End-to-End RGBA Image Reconstruction and Generation with Alpha-Aware Representation Learning

Zile Wang, Hao Yu, Jiabo Zhan, Chun Yuan

论文 / PDF / 代码 / 模型 / Scholar

  • 面向端到端 RGBA 图像重建与透明图像生成的 Alpha-aware VAE,并配套提出 ALPHA 评测基准。
  • 个人贡献:完成 8,124 张高质量 RGBA 训练样本的收集、清洗与治理,并参与 benchmark、评测代码和 LoRA 数据迭代流程设计。

技术报告

WeVisDoc-4B 在 OmniDocBench 与 PureDocBench 上的评测结果

WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing

Hao Yu*, Kang Liu*, Linnan Zhao*, Jiabo Zhan*, Chong Sun, Chen Li, Jing Lyu

* 共同一作。技术报告,2026。

报告 / PDF / 项目主页 / 代码 / 模型(2B) / 模型(4B)

  • 提出两阶段数据驱动框架:先扩展文档数据覆盖,再通过残余错误诊断指导定向数据构建与训练预算分配,提升端到端文档解析的鲁棒性。
  • WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 的 Overall 分数,在 PureDocBench 三个赛道上的平均 Overall 分数为 75.54,在四项设置中均位列所比较的端到端解析器第一。

🎓 教育背景

清华大学 · 深圳国际研究生院
2026.09 – 2028.06(预计)
计算机技术硕士 · 导师:袁春教授

研究方向:计算机视觉、多模态大模型与强化学习。

北京航空航天大学 · 软件学院
2022.09 – 2026.06
软件工程学士 · GPA:3.873/4.0 · 加权平均分:93.005/100

专业排名 2/172(前 1.2%),免试攻读清华大学计算机技术硕士学位。

💼 科研与实习经历

VFlow AI 视频生成 · 清华大学深圳国际研究生院
2025.12 – 2026.06
算法实习 · 袁春教授横向项目
  • 参与构建页面级多模态理解 pipeline,将商品详情页、商品图片与营销文案转化为结构化属性、脚本及生成视频。
  • 负责图文样本和指令数据构建与清洗、prompt 模板迭代及离线评测,重点关注视觉 grounding、结构化信息抽取和多轮生成质量。
Momenta
2025.09 – 2025.11
算法实习 · 自动驾驶路况分类
  • 基于 Qwen3-VL 构建融合相机图像与车速、位置等 rosbag 结构化信号的路况分类方案,完成评测集、prompt 与离线评测流程设计。
  • 将高成本 Gemini-2.5 Pro 流程迁移为可部署的开源 VLM 方案,在接受准确率由 80% 降至 70% 的情况下,将分类成本降低约 80%。

🏆 奖项荣誉

  • 国家奖学金:2022–2023、2023–2024 学年。
  • 连续三个学年获评北京航空航天大学校级三好学生,并获校级优秀团员
  • 三星奖学金(2024–2025 学年);全国大学生数学竞赛北京市一等奖

🛠 专业技能

模型与训练
VLM、VAE、DiT、多任务 SFT、GRPO 风格强化学习后训练;熟悉 DPO 与 PPO。

数据与评测
训练数据构建与治理、benchmark 设计、评测流水线、离线评测及误差分析。

多模态理解
视觉 grounding、OCR、版面分析、关键信息抽取及图像—文本—结构化信号联合建模。

工程能力
Python、PyTorch、C/C++、Java;具备多模态 pipeline 工程化与产品化落地经验。

外语能力
英语 CET-4:662 分,CET-6:633 分。

其他经历
《大学英语》《编译技术》课程助教;志愿北京累计 250 小时。