Lamoda
Наши ожидания: – Опыт промышленной разработки, внедрения или эксплуатации GenAI-, ML- или Data-платформ. – Практический опыт работы с LLM-инференсом: vLLM, Text Generation Inference, Triton Inference Server, llama.cpp или аналогичные решения. – Понимание особенностей эксплуатации LLM: задержки, throughput, batch-запросы, потоковая генерация, контекстное окно, потребление памяти, GPU-ресурсы и стоимость инференса. – Опыт проектирования или эксплуатации API для доступа к моделям, включая OpenAI-совместимые интерфейсы, авторизацию, лимиты, маршрутизацию и отказоустойчивость. – Понимание принципов RAG: разбиение документов на фрагменты, эмбеддинги, векторный и гибридный поиск, reranking, фильтрация, версионирование индексов и оценка качества retrieval.
Зарплата
300 000 – 450 000 ₽