Criando reconhecimento de voz no DeepSeek Harness em 6 minutos
Como você já sabe, no DeepSeek Harness tudo é plugin. E é exatamente isso que a gente vai construir agora.
Vou criar um sistema de reconhecimento de voz igual ao que existe no Antigravity, no Claude Code e no Codex. E a gente vai fazer isso junto, em 6 minutos, dentro do próprio DeepSeek Harness, usando um modelo da DeepSeek. Liga o relógio aí.
O prompt que criou o plugin
Na instalação limpa não existe microfone nenhum na caixa de entrada. Então mandei isto:
Quero criar um novo plugin na pasta plugins do DeepSeek Harness para adicionar reconhecimento de voz usando uma versão local do Whisper da OpenAI. O plugin deve adicionar um botão de microfone ao lado da seta de envio da caixa de texto. Enquanto o usuário estiver falando, deve ser exibida uma animação de onda em tempo real, reagindo à intensidade do áudio, para indicar visualmente que a voz está sendo capturada. Após a transcrição do Whisper, o texto reconhecido deve ser adicionado à caixa de texto da conversa do harness, sem apagar ou substituir o conteúdo que já estiver nela. A implementação deve respeitar a arquitetura de plugins existente e evitar alterações desnecessárias no núcleo do harness.
Em poucos minutos ele entregou o plugin dsh-whisper-input, com a frase que eu queria ler: zero mudanças no núcleo do harness. Que era exatamente o que eu queria.
Para ativar, você precisa matar o processo antigo com um Ctrl+C, fechar o browser e subir o servidor de novo.
Os dois ajustes que faltaram
Acentuação. A primeira transcrição funcionou, mas voltou com uns caracteres estranhos. Copiei o resultado, colei na mesma sessão e falei que estava com problema de encoding. Ele achou o arquivo transcribe.py que tinha criado, ajustou para UTF-8, e resolveu ali mesmo, sem precisar reiniciar nada.
Modelo fraco demais. Aí eu testei com uma frase difícil, daquelas do Chaves, cheia de acento, e ele errou várias palavras. Talvez tenha pegado meu sotaque também.
Pedi para ele listar os modelos Whisper disponíveis e escolhi o medium, em português, multilíngue. E como eu tenho placa de vídeo aqui, pedi para ativar a GPU, que fica bem mais rápido.
Depois desse ajuste, falei a mesma frase e ela saiu inteira, certinha, e rápido. Ficou muito bom.
Instalando o DeepSeek Harness do zero
Agora, para você que ainda não instalou, o processo é super simples. Na página do projeto no GitHub existem dois caminhos de instalação, e eu não recomendo aquele comando único. Prefira executar linha a linha:
git clone <repositorio-do-deepseek-harness>
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
O pnpm é o gerenciador de pacotes do JavaScript e do TypeScript, e o dsh é a abreviação de DeepSeek Harness. Esse último comando já abre o harness automaticamente no navegador. Ele dá um aviso interessante, dizendo que ainda está em fase de teste e que feedback da comunidade é bem-vindo.
Na primeira execução ele pede uma API key da DeepSeek. Para pegar a sua:
- entre em
platform.deepseek.come faça login (pode ser com o Google); - coloque um crédito na conta;
- vá em API Keys, crie uma chave nova e copie;
- cole no harness, salve e escolha a sua pasta de trabalho.
Um "olá" já responde super rápido.
O que isso significa
Esse é o detalhe mais importante do vídeo todo: na instalação original não existe conversa por voz, e foi exatamente isso que a gente construiu.
Se a capacidade não existe, você inventa, você cria e você coloca. Cada harness pode ter uma estrutura e uma composição própria, adequada às necessidades que forem aparecendo para você.
Nesse caso, você não precisa ficar esperando a empresa que construiu o harness liberar a capacidade. Você mesmo chega lá e constrói, como a gente fez aqui em alguns minutos.