Head of Machine Learning Infrastructure
Job Description
<p><span style="font-size: 18pt; color: rgb(61, 116, 204);"><strong>关于我们</strong></span></p> <p class="p1"><span style="color: rgb(61, 116, 204);"><span class="s1"><strong>安贤投资</strong></span><span class="s1"><strong>(</strong></span><strong>AXQ Capital</strong><span class="s1"><strong>)</strong></span></span>是一家全球量化投资机构。我们立足不同地域、资产类别和交易周期,持续构建多元化的投资优势。我们的策略植根于严谨的量化研究与深入的市场理解,并通过对数据、技术和人工智能的长期投入不断强化。我们汇聚来自全球顶尖高校及领先量化机构的优秀人才,倡导以好奇心、严谨精神和主人翁意识为基础的合作文化。在这里,最好的想法能够脱颖而出,每个人也能与公司共同成长。</p> <p class="p1"> </p> <p><span style="font-size: 18pt; color: rgb(61, 116, 204);"><strong>岗位使命</strong></span></p> <p data-renderer-start-pos="451">作为 <strong>Head of Machine Learning Infrastructure</strong>,你将向 CTO 汇报,负责公司面向机器学习和量化研究的核心计算与平台基础设施,包括 <strong>GPU/CPU 集群、分布式训练、研究计算平台、机器学习平台及开发者工具</strong>。<br>核心目标是打造一套能够支撑<strong>大规模特征工程与机器学习训练</strong>的基础设施体系,支持 <strong>PB 级数据处理能力</strong>,并能够高效利用<strong>数十 TB 级别训练数据进行模型训练与实验迭代</strong>。系统需具备高性能、可扩展、可复现、易使用且成本高效的特性,持续提升研究与工程效率。</p> <p data-renderer-start-pos="451"> </p> <p data-renderer-start-pos="818"><span style="font-size: 18pt; color: rgb(61, 116, 204);"><strong>主要职责</strong></span></p> <div> <div> <ul> <li>负责机器学习基础设施团队建设、技术规划和项目推进,制定中长期平台路线。</li> <li>建设和优化 GPU/CPU 集群、任务调度和分布式计算平台,支持大规模模型训练、特征计算和量化研究。</li> <li>构建支持 <strong>PB 级数据规模的特征工程与数据处理平台</strong>,提升海量数据的计算、存储与访问效率。</li> <li>支持基于<strong>数十 TB 级训练数据</strong>的分布式训练与实验体系,优化数据加载、并行训练与资源调度效率。</li> <li>建设统一的机器学习平台,包括开发环境、实验管理、模型版本、依赖管理和模型部署流程。</li> <li>优化训练与研究场景下的存储、网络、数据管道和计算性能,提高 GPU/CPU 资源利用率并控制基础设施成本。</li> <li>建设模型训练、批量/在线推理及相关生产基础设施,提升模型从研究到生产的效率和可靠性。</li> <li>持续优化开发者工具和研究工作流,提升大规模数据与模型实验的迭代效率。</li> <li>建设平台监控、容量规划、权限、安全和自动化体系,保障大规模系统的稳定性与可维护性。</li> </ul> <div> </div> <div><span style="font-size: 18pt; color: rgb(61, 116, 204);"><strong>岗位要求</strong></span></div> <ul> <li>8 年以上机器学习基础设施、分布式系统、平台工程、高性能计算或云基础设施相关经验。</li> <li>有基础设施或平台团队管理经验,以及复杂系统架构和落地能力。</li> <li>扎实的 Linux、网络、存储、分布式系统和容器技术基础。</li> <li>熟悉 GPU 计算、分布式训练和大规模机器学习工作负载,对任务调度、数据 I/O、特征工程和系统性能优化有实践经验。</li> <li>熟悉 Python、Go、C++、Rust、Java 等至少一门编程语言。</li> <li>熟悉 Kubernetes、Docker、CI/CD、Infrastructure as Code、监控和云计算基础设施。</li> <li>具备较强的平台产品意识,能够深入理解量化研究员、机器学习研究员和工程师在大规模数据与模型训练场景下的需求。</li> </ul> <div><strong>加分项</strong></div> <ul> <li>有量化投资、对冲基金、机器学习平台或大规模研究计算平台经验。</li> <li>有 GPU 集群、分布式训练或 HPC 平台建设经验。</li> <li>熟悉 PyTorch Distributed、Ray、Slurm、NCCL、CUDA、RDMA 等技术。</li> <li>有大规模特征工程平台、数据管道系统或 PB 级数据处理经验。</li> <li>有 AWS、GCP、阿里云、腾讯云等云平台的 GPU 资源和成本优化经验。</li> <li>熟悉 Claude Code、Codex、Cursor 等 AI coding tools,并有推动其团队化应用的经验。</li> </ul> </div> </div> <div> <p> </p> </div>