About this role
About the role
VESSL AI는 AI 기업에 GPU 인프라를 제공하는 GPU Cloud 기업입니다. 폭발적으로 증가하는 AI 컴퓨팅 수요 속에서, 저희는 GPUaaS(GPU-as-a-Service)를 통해 AI 기업들이 필요한 GPU 컴퓨팅 자원을 필요한 시점에 안정적으로 확보할 수 있도록 돕고 있습니다. 현재 Upstage, SqueezeBits, Holiday Robotics 등 국내의 다양한 기업 및 스타트업은 물론, UC Berkeley, Stanford, Subquadratic, Nuance Labs 등 미국의 선도적인 학계 및 프론티어 랩에서도 VESSL AI의 제품을 사용하고 있습니다. 2026년 기준 전년 대비 20배 이상 성장하며, 글로벌 AI 인프라 시장에서 가장 빠르게 성장하는 기업 중 하나로 자리매김했습니다.
다른 GPU Cloud와 달리, VESSL AI는 단순히 GPU를 공급하는 데 그치지 않습니다. 고객의 AI 워크로드를 깊이 이해하고, 이를 바탕으로 최적의 인프라 솔루션을 제공합니다. 이를 위해 R&D 팀은 다양한 모델을 검증하고 벤치마킹하며, Agentic 워크로드에 최적화된 Post-Training과 Inference를 직접 구축하고 있습니다. 현재 팀의 연구는 두 가지 핵심 축을 중심으로 이루어지고 있습니다. 첫 번째는 Agentic AI를 위한 RL 기반 Post-Training으로, 강화학습을 활용해 실제 Agentic 워크로드에서 요구되는 추론(reasoning), 도구 사용(tool-use), 코딩 능력을 강화하는 연구입니다. 두 번째는 대규모 Agentic AI 모델 서빙을 위한 분산 캐시 최적화 및 최신 가속기 커널 최적화로, H200부터 B200, B300, GB300에 이르는 최신 GPU에서 추론 효율을 극한까지 끌어올리는 연구입니다.
Senior AI Research Engineer는 핵심 멤버로서 LLM Inference 최적화와 Post-Training을 직접 담당하며, 두 축 중 본인의 전문성에 가장 잘 맞는 영역에서 문제를 정의하고 해결하는 일을 주도하게 됩니다. 풍부한 GPU 자원을 바탕으로 대규모 프론티어 연구를 수행하고, 그 결과를 VESSL의 제품과 고객 경험에 직접 반영하게 됩니다.
What you will do
- LLM 서빙/추론 최적화 연구: 대규모 GPU 클러스터 환경에서 vLLM, SGLang 등 프레임워크 기반 엔진의 추론 효율을 개선하며, Multi-token Prediction, Speculative Decoding, Lossless Compression, Kernel Optimization(CUDA, Triton 등)에 집중합니다.
- LLM Post-Training 연구: verl , vime , slime 을 활용해 멀티노드 대규모 Post-Training 파이프라인을 설계하고, Reasoning/Math/Code 도메인 전반에 걸쳐 강화학습(Reinforcement Learning) 및 On/Off-policy Distillation을 직접 구현하고 최적화합니다.
- 연구의 제품화(Research-to-product): 벤치마킹과 모델 검증을 통해 연구 성과를 VESSL의 Inference/Post-Training 제품 기능과 실제 고객 워크로드에 반영합니다.
- R&D 방향 설정 및 팀 리더십: 연구 우선순위와 로드맵 논의를 주도하고, 코드/설계 리뷰, 기술 문서화, 주니어 엔지니어 멘토링을 통해 팀의 연구 역량을 강화합니다.
- 최신 연구 트래킹 및 공유: Agentic AI 및 LLM 서빙/학습 분야의 최신 논문과 오픈소스 프로젝트를 지속적으로 리뷰하고, 사내 스터디 및 세미나를 통해 인사이트를 공유합니다.
Qualifications
- 컴퓨터공학, 전기전자공학, AI/ML 또는 관련 분야 박사 학위 소지자, 또는 석사 학위와 4년 이상의 실무/연구 경험 보유자
- Speculative Decoding, Lossless Compression, Kernel Optimization(CUDA, Triton 등) 중 하나 이상의 분야에서 유의미한 추론 성능 향상을 이끌어낸 경험
- 대규모 언어 모델(LLM)의 Fine-tuning 또는 Post-Training을 통해 모델 성능을 개선한 경험
- 최신 논문을 빠르게 읽고 핵심 아이디어를 코드로 구현·검증할 수 있는 역량
- 팀 프로젝트나 연구실에서 연구 로드맵 또는 기술적 의사결정을 주도한 경험
- 비즈니스 수준의 영어 커뮤니케이션 능력
Helpful experience (not required)
- NeurIPS, ICML, MLSys 등 국제 ML/시스템 학회 논문 게재 경험
- vLLM, SGLang, verl, slime 등 오픈소스 프로젝트 기여 경험
- RL 알고리즘(GRPO, PPO 등) 및 FlashAttention, Quantization(MXFP4/NVFP4/W4AFP8), Continuous Batching 등 최신 추론 최적화 기법에 대한 깊은 이해
- 연구자/엔지니어 채용, 온보딩, 멘토링을 통해 팀 성장에 기여한 경험
- 멀티노드 GPU 클러스터 운영(Slurm, Kubernetes 등)에 대한 이해
- 정해진 범위에 머무르기보다, 문제 해결이 필요할 때 SWE/인프라/제품의 경계를 넘나들며 직접 손을 움직이는 데 거리낌이 없는 분
- 모호하고 정답이 정해지지 않은 문제 앞에서도 답을 찾을 때까지 스스로 깊이 파고드는 것을 즐기는 분