目录
目录
参赛概况
2025 年,我以 Lu.Lab 团队队长身份参加广州国家实验室第三届 Bio-OS AI 开源大赛。团队选择密码子优化任务:根据蛋白质氨基酸序列和目标宿主,生成同义编码 DNA 序列。
Lu.Lab 团队于 2025 年 12 月 21 日获得一等奖。算法细节另见科研项目记录。
任务约束
团队把任务分成两类目标:
- 硬约束:生成 DNA 翻译后必须与输入蛋白质序列一致。
- 软目标:在满足翻译一致性的基础上,进一步考虑 CAI、GC 含量、稀有密码子、重复片段、酶切位点和 5′ 端结构风险等因素。
这一区分决定了整个方案的优先级:先保证输出合法,再讨论优化程度。
参赛时间线
- 2025-10-24:完成初赛材料提交。
- 2025-11-10:进入复赛。
- 2025-12-16:复赛排名第 2。
- 2025-12-18:完成决赛算法报告。
- 2025-12-21:参加决赛并获得一等奖。
三轮方案如何演进
初赛:正确性优先
初赛阶段围绕模型微调和多宿主序列生成建立基本流程。每条输出都要经过翻译一致性校验;失败时重新采样,仍不满足条件时进入兜底流程。
这一阶段的目标不是展示最复杂的模型,而是保证交付结果满足硬约束。
复赛:增加可解释优化
复赛阶段生成两个具有不同采样倾向的候选序列,再使用规则优化器处理软目标。每个规则执行后重新校验;若破坏翻译一致性或序列合法性,就回退该步骤。
这种设计把“生成”与“验证”分开,也让每次修改更容易解释。
决赛:打通交付链路
决赛阶段把 Excel 输入、FASTA 转换、模型推理、规则优化和结果回写串成端到端流程,减少手工转换和复制产生的错误。
最终方案可以概括为:
模型生成
→ 严格校验
→ 规则优化
→ 再次校验
→ 自动化交付
我的实践重点
作为团队队长,我更关注三个跨模块问题:
- 算法模块的输入、输出和验收标准是否一致;
- 模型、规则优化与交付脚本之间能否稳定衔接;
- 竞赛材料能否准确说明方案,不把设计目标写成已经证明的普遍结论。
这次比赛留下的经验
生物学约束应进入程序
“生成结果看起来像 DNA”远远不够。翻译一致性必须成为自动校验步骤,而不是交付前依靠人工抽查。
失败处理也是算法的一部分
重试、回退、兜底和错误记录决定了系统能否稳定交付。它们不只是外围工程代码。
指标不能替代适用边界
不同宿主、基因和表达系统的约束并不完全相同。竞赛方案证明团队完成了特定任务,不能直接外推为对所有表达场景都有效。
团队交付需要统一接口
多人分别负责数据、模型、规则和文档时,最容易出问题的是模块边界。明确文件格式、命名、校验条件和版本,比在最后阶段集中拼接更可靠。