← 回到招聘
研究实习(博士)
- 办公地
- 香港科技大学
- 类型
- 实习
这条线与香港科技大学的实验室共同指导,不进产品线。目标是论文,短期不落业务——我们不指望它在这个季度产生收入,也不会因此去催它。
三个方向,任选其一。
三个方向
一、评测基准(Benchmark)
为电商经营建立自己的评测标准,并跑出三条基线的对照数据:通用 agent 的上限、垂直竞品、以及人类运营的基线。最后一条最难也最有价值——要量一个 agent 做经营决策的水平,你得先知道人做到什么水平。
产出:benchmark 论文。
二、自进化 Agent(Self-Evolving)
方向是 Self-Evolving Agents with Economic Ground Truth。
别人的自进化研究大多跑在合成的 benchmark 上——agent 在一个自己造的环境里自我改进,改进了什么很难说清。我们这边的 reward 是真金白银的经营利润,来自真实的生意。信号更脏,但它是真的。
产出:论文。
三、模型后训练(Post-training)
在 7B / 14B 规模上,对工具调用序列与技能调度做后训练,并在我们自己的评测基准上量出提升。
产出:论文。
我们期待你
- Agentic System 方向在读博士
- 有独立推进一个方向的能力。你认下的方向由你自己往前走,没有人会替你想下一步做什么
- 熟练使用 Claude Code 这类工具。这是硬性要求,不是加分项
- 愿意和产品线的人说话。你的数据来自真实业务,而那些人坐在另一条线上