Channels / CY iT HR
CY iT HR
@cyprusithr · supergroup
· filtered by
Дарья✨
← Prev Day
Sep 30 2026
Дарья✨
2026-09-30 11:55 UTC
#vacancy #Lead #ML
🔥 Lead ML Engineer | LLM Inference | Remote
Ищу не просто ML Lead, а очень сильного hands-on инженера, который реально работал с inference больших LLM в production.
Здесь важен именно масштаб: модели до 1T параметров, distributed inference, GPU-кластеры и задачи, где нужно одновременно улучшать latency, throughput, cost и stability.
Что будет в работе:
• production inference больших LLM
• distributed inference и оптимизация serving
• SGLang - уже используется в prod
• post-training LLM
• agent harness
• caching, batching, quantization, speculative decoding
• работа с GPU-инфраструктурой - сейчас 32×H200 + AWS, планируется расширение
• техническое лидерство NLP/CV направления
Роль примерно на 70% hands-on. People management, performance review и 1:1 здесь нет.
Что критично:
• сильный production LLM inference
• опыт distributed inference больших моделей
• vLLM / SGLang / TensorRT-LLM или сопоставимый стек
• понимание tensor/pipeline/expert parallelism, KV cache, GPU optimization
• post-training: SFT / DPO / RLHF и т.д.
• сильная база в ML / CS / математике
Большой плюс: CUDA/Triton, DeepSpeed, Megatron-LM, FSDP, MoE, свои статьи, PhD, research или заметный open-source contribution.
Не ищем человека, который преимущественно делал RAG, LangChain, API-интеграции или просто деплоил готовые LLM. Здесь нужна глубокая работа с самими моделями и их инференсом.
🌍 Remote, B2B (вне РФ,РБ)
🕐 CET-friendly timezone
🔞 В продукте присутствует 18+ контент
Если ты сам ускорял большие LLM в production и понимаешь, что происходит с моделью на уровне GPU, serving и distributed systems - пиши мне в личку.
@SelitskayaDaria (локация, запрос зп, самари по требованиям)
🔥 Lead ML Engineer | LLM Inference | Remote
Ищу не просто ML Lead, а очень сильного hands-on инженера, который реально работал с inference больших LLM в production.
Здесь важен именно масштаб: модели до 1T параметров, distributed inference, GPU-кластеры и задачи, где нужно одновременно улучшать latency, throughput, cost и stability.
Что будет в работе:
• production inference больших LLM
• distributed inference и оптимизация serving
• SGLang - уже используется в prod
• post-training LLM
• agent harness
• caching, batching, quantization, speculative decoding
• работа с GPU-инфраструктурой - сейчас 32×H200 + AWS, планируется расширение
• техническое лидерство NLP/CV направления
Роль примерно на 70% hands-on. People management, performance review и 1:1 здесь нет.
Что критично:
• сильный production LLM inference
• опыт distributed inference больших моделей
• vLLM / SGLang / TensorRT-LLM или сопоставимый стек
• понимание tensor/pipeline/expert parallelism, KV cache, GPU optimization
• post-training: SFT / DPO / RLHF и т.д.
• сильная база в ML / CS / математике
Большой плюс: CUDA/Triton, DeepSpeed, Megatron-LM, FSDP, MoE, свои статьи, PhD, research или заметный open-source contribution.
Не ищем человека, который преимущественно делал RAG, LangChain, API-интеграции или просто деплоил готовые LLM. Здесь нужна глубокая работа с самими моделями и их инференсом.
🌍 Remote, B2B (вне РФ,РБ)
🕐 CET-friendly timezone
🔞 В продукте присутствует 18+ контент
Если ты сам ускорял большие LLM в production и понимаешь, что происходит с моделью на уровне GPU, serving и distributed systems - пиши мне в личку.
@SelitskayaDaria (локация, запрос зп, самари по требованиям)
← Prev Day
Sep 30 2026
1 message on this day