Voltar

PixelMind

Editor de vídeo que aceita comandos em linguagem natural, primeiro lugar no hackathon do Trilha

Arquiteto backend

Repositório privado

Sobre o projeto

PixelMind permite editar vídeo conversando com o sistema. Em vez de procurar o trecho na timeline, a pessoa escreve o que quer (por exemplo, remover a parte em que se fala sobre determinado assunto) e o sistema localiza e executa o corte. O projeto conquistou o primeiro lugar entre seis equipes no hackathon do Trilha, iniciativa do TRIL Lab na UFPB, e foi construído em cerca de um mês. Nasceu como um backend único em TypeScript e cresceu para uma arquitetura de múltiplos serviços conforme novas capacidades entraram: transcrição, análise semântica e, por fim, tratamento de áudio. A ideia por trás dele é tornar a edição acessível a quem não domina ferramentas tradicionais, transformando a transcrição do próprio vídeo no índice pelo qual ele é manipulado.

Como funciona

O vídeo enviado tem o áudio extraído com FFmpeg e transcrito pelo Whisper, que devolve marcações de tempo por trecho. O Gemini analisa esse texto e constrói um mapa semântico do conteúdo. Quando chega um comando em linguagem natural, o modelo interpreta a intenção, localiza os trechos correspondentes na transcrição e o FFmpeg executa os cortes usando as marcações de tempo. A qualidade do áudio fica a cargo de um microsserviço Python dedicado, que aplica redução espectral de ruído com librosa e noisereduce e devolve a faixa tratada para remontagem do vídeo final.

Arquitetura

  1. 01

    Frontend Next.js com App Router, TypeScript e Tailwind

  2. 02

    Backend Node.js e TypeScript: upload, orquestração e controllers de corte, transcrição e análise

  3. 03

    Microsserviço Python FastAPI dedicado à redução espectral de ruído

  4. 04

    FFmpeg: extração de áudio e execução dos cortes

  5. 05

    Whisper para transcrição com marcação de tempo e Gemini para análise semântica

Funcionalidades

  • Edição de vídeo por comando em linguagem natural
  • Transcrição automática com marcação de tempo
  • Análise semântica do conteúdo falado
  • Corte preciso guiado pela transcrição
  • Redução espectral de ruído em microsserviço dedicado
  • Acompanhamento das etapas de processamento na interface

Tecnologias

Frontend
Next.js · TypeScript · Tailwind CSS
Backend
Node.js · Python · FastAPI
AI/ML
Whisper · Gemini · librosa · noisereduce
Tools
FFmpeg