到岗时间:不限
婚况要求:不限
一、岗位职责
1. 大模型训练与优化
主导企业级大语言模型、多模态模型的预训练、微调(SFT/DPO/RLHF/LoRA),优化模型训练策略,提升模型准确性、性能与稳定性。
负责Transformer、Diffusion等核心架构的改进与创新,结合稀疏注意力、知识增强等技术,解决模型训练速度、推理时延等关键问题。开展多模态(文本、图像、音频)跨模态对齐与生成算法研发,支撑多场景业务应用落地。
2. 训练平台搭建与工程化部署
搭建分布式训练平台,实现模型的高效并行计算与规模化训练,优化训练资源调度与成本控制。
负责模型的量化、轻量化与容器化部署,基于Docker、Kubernetes完成集群管理与云平台服务搭建,保障千万级用户实时交互需求。
开发RESTfulAPI接口,实现模型与业务系统、AI能力平台的无缝集成。
3. 数据体系构建与优化
主导高质量语料库、训练数据集的构建,优化数据预处理、数据增强策略,开展特征工程与数据分析,保障训练数据质量。
处理TB级大规模数据,解决数据稀疏、噪声等问题,提升模型在特定领域的适配性与准确率。
4. 跨团队协作与技术赋能
与AI应用研发、产品、前端/后端团队紧密协作,梳理业务需求并转化为技术方案;
持续跟踪多模态大模型、MLOps等前沿技术,定期输出技术调研报告,推动现有系统的性能优化与功能升级。
二、任职要求
1.教育背景与工作经验
计算机科学、人工智能、机器学习、自然语言处理等相关专业本科及以上学历,硕士优先;
2年以上AI算法开发及模型训练经验,有大型企业级大语言模型、多模态模型训练经验(如自研模型增量预训练、行业定制化模型研发部署);
有勘察设计、工程建设等ToB行业落地经验者优先。
2.核心技术能力
精通Python,具备扎实的代码风格与调试能力;熟练掌握至少一种主流深度学习框架(PyTorch优先,了解TensorFlow),能独立完成模型训练、评估与优化;
深入理解Transformer、LSTM、Diffusion等核心架构,掌握大模型LoRA、RLHF、知识蒸馏相关模型训练技术,有过基于Qwen、GLM等开源模型的行业适配经验,具备 MoE 技术相关经验者优先;
具备大规模多模态训练数据处理经验,能设计高效的数据清洗与训练数据生成方案;
熟悉AI Agent研发的相关概念,例如上下文工程、MCP、Agent Skills、RAG、长短期记忆、任务规划与分解等。
3.团队协作与沟通能力
具备优秀的跨团队协作能力,具备清晰的技术沟通与方案表达能力,可高效对接业务需求与技术实现。
4.持续学习能力
对大模型技术领域新技术保持高度敏感性,愿意持续投入学习并应用于实际工作。
5.加分项
参与过开源人工智能项目,有技术专利或学术论文发表者优先。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。