任职要求:
专业背景:计算机、电子信息、自动化或数学等相关专业硕士及以上学历。
岗位职责:
核心技术栈
音频方向:熟悉 Whisper、FunASR 等开源工具;了解音频特征提取、语音分离技术经验者优先;
视觉/跨模态方向:了解生成式模型(GANs、Diffusion Models、Flow Matching);
工程能力:精通 Python、PyTorch,具有良好的论文阅读和调研能力
业务理解:对视频翻译中的“音画同步率”、“时间轴错位”、“译文超长导致的TTS挤压”等痛点有实际踩坑经验和解决方案优先。
加分项:
1、在顶级音视频/AI 会议(ICASSP, INTERSPEECH, CVPR, ICCV, ECCV)发表过高水平论文。
2、有从零构建端到端视频翻译系统、或虚拟数字人互动系统落地经验。
3、熟悉多模态大模型(MLLM)在音视频对齐或上下文理解中的应用。