我们正在寻找一位对AI技术充满热情、注重细节的工程师,负责将前沿的AI评测基准(Benchmark)适配并迁移到我们专有的AI Agent评测框架上。你的工作将直接决定我们如何量化和评估AI模型的智能水平,是连接AI研究与工程化落地的核心桥梁。核心职责:评测集迁移与适配:深入理解业界主流的AI/Agent评测集,负责将其数据结构、评测逻辑和评估指标,精准地适配并迁移到公司内部的统一评测框架上,解决适配迁移过程中面临的各自问题。评测任务执行与监控:负责大规模评测任务的部署、执行与监控,确保评测过程的稳定性和数据产出的准确性。结果分析与报告:对评测结果进行初步的数据清洗和格式化,为算法团队提供清晰、可靠的性能数据报告,并能定位因适配问题导致的数据异常。任职要求:教育背景:计算机相关专业,本科及以上学历, 2年以上相关工作经验。编程能力:有一定的python开发能力,熟悉JSON、YAML等数据格式,熟悉Linux开发环境,能够使用Shell脚本进行自动化任务。评测能力: 具备处理复杂评测逻辑的能力,理解Judge评测范式,了解Agent的评估指标,不仅限于文本生成质量,还包括对规划能力、工具调用成功率等维度,了解代码类评测基准(如HumanEval, SWE-bench),能够确保评测集迁移准确性。理解与沟通能力:能够快速阅读并理解技术论文和开源项目文档,准确把握评测集的核心逻辑。能够与算法研究员和框架开发工程师进行高效沟通,清晰表达适配过程中遇到的问题和需求。