Stack
Pipeline CV: NVIDIA DeepStream 9.0, TensorRT (build/otimização de engines), GStreamer, CUDA, ONNX/onnxruntime-gpu.
Modelos faciais: InsightFace — ArcFace / AdaFace / MagFace (embeddings); detecção facial YOLO-face.
OCR / LPR: LPRNet (TensorRT) + decoder CTC; pipeline de placas.
Detecção: YOLO (Ultralytics, v8n/v26n COCO), YOLOWorld + CLIP (open-vocabulary), Grounding DINO (TensorRT).
ReID: OSNet (TRT + fallback Triton/ONNX).
Enhancement: GFPGAN + RealESRGAN (super-resolução de face/placa).
Áudio: classificação acústica via ONNX (PANNs export).
MLOps / Infra: Docker (otimização de imagem), arquitetura de sidecars (FastAPI por serviço de inferência), Prometheus/NVML para observabilidade de GPU, GitHub Actions, scripts de provisionamento (compilação de engines TensorRT no boot), Redis.
Backend de integração: Python 3.12 + FastAPI (os sidecars e o orquestrador
Requisitos obrigatórios
4+ anos em engenharia de software, com forte experiência em Computer Vision / Deep Learning em produção
MLOps: versionamento de modelos, deploy de modelos em containers, monitoramento de inferência, estratégias de hot-swap/rollback, detecção de drift entre "modelo em runtime vs. target”.
Treinamento e otimização de modelos: fine-tuning, quantização, conversão para TensorRT/ONNX, redução de latência e VRAM, batching dinâmico.
OCR e reconhecimento (face/placa): da extração de crop ao matching com watchlist.
Domínio de GPU/NVIDIA (CUDA, nvidia-smi/NVML, gestão de VRAM, pressão/adaptive shedding).
Python avançado + FastAPI; conforto com Docker e pipelines de CI/CD.
Capacidade de planejar e influenciar positivamente: escrever specs/planos, propor trade-offs, conduzir decisões arquiteturais e justificá-las.
Trabalho em equipe e mentoria: revisar PRs do perfil pleno, alinhar com produto, comunicar com clareza.
Desejável / diferencial
DeepStream/GStreamer especificamente (nvstreammux, nvinfer, probes, metadata).
Streaming de mídia em escala (OvenMediaEngine, SRT/RTMP, sincronização sub-stream→main).
TimescaleDB / sistemas de eventos em alta cardinalidade.
Triton Inference Server; modelos vision-language (CLIP, Grounding DINO).
Experiência on-premise multi-servidor (não só cloud-managed).