跳到正文
Global Optima
回到招聘

研究实习(博士)

办公地
香港科技大学
类型
实习

这条线与香港科技大学的实验室共同指导,不进产品线。目标是论文,短期不落业务——我们不指望它在这个季度产生收入,也不会因此去催它。

三个方向,任选其一。

三个方向

一、评测基准(Benchmark)

为电商经营建立自己的评测标准,并跑出三条基线的对照数据:通用 agent 的上限、垂直竞品、以及人类运营的基线。最后一条最难也最有价值——要量一个 agent 做经营决策的水平,你得先知道人做到什么水平。

产出:benchmark 论文。

二、自进化 Agent(Self-Evolving)

方向是 Self-Evolving Agents with Economic Ground Truth

别人的自进化研究大多跑在合成的 benchmark 上——agent 在一个自己造的环境里自我改进,改进了什么很难说清。我们这边的 reward 是真金白银的经营利润,来自真实的生意。信号更脏,但它是真的。

产出:论文。

三、模型后训练(Post-training)

在 7B / 14B 规模上,对工具调用序列与技能调度做后训练,并在我们自己的评测基准上量出提升。

产出:论文。

我们期待你

  • Agentic System 方向在读博士
  • 有独立推进一个方向的能力。你认下的方向由你自己往前走,没有人会替你想下一步做什么
  • 熟练使用 Claude Code 这类工具。这是硬性要求,不是加分项
  • 愿意和产品线的人说话。你的数据来自真实业务,而那些人坐在另一条线上

怎么投递

把简历发到下面的地址,标题里注明岗位。附上一段你用 AI 完成过的真实工作——什么活、你怎么组织的、省下了什么。这一段比简历更能说明问题。

hello@theglobaloptima.com