Gravação → documento
Uma gravação de tela vira documento: só os instantes em que a tela muda, cada um com a hora exata e com o que estava sendo dito. Serve para provar que o teste foi feito e serve para entregar a uma IA. Roda inteiro no seu navegador — nada sai do seu computador.
Sem cadastro, sem instalação, sem limite de tamanho. O vídeo é processado dentro do seu navegador e não é enviado para servidor nenhum.
Um vídeo de uma hora não é anexável em lugar nenhum: não cabe num chamado, não cabe numa ata, e ninguém vai assistir. O Claude e o ChatGPT recusam arquivo de vídeo; o Gemini aceita e amostra um quadro por segundo às cegas — 3.600 imagens e mais de um milhão de tokens, quase tudo repetição da tela anterior. Tirar print na mão tem o defeito oposto: dá trabalho, e some a hora de cada um.
O mesmo trabalho, dois destinos
Tirar print de cada passo e escrever a legenda embaixo. Ou explicar para um modelo o que aconteceu num vídeo de uma hora. São o mesmo problema — transformar tempo em documento — e é por isso que uma ferramenta só resolve os dois.
Teste sem evidência não passa em auditoria. Hoje isso é Print Screen → colar no Word → escrever a legenda, quarenta vezes. Grave uma vez e receba o documento pronto.
Modelo que assiste vídeo amostra um quadro por segundo, às cegas. Uma hora vira 3.600 imagens e mais de um milhão de tokens — e você repaga a cada pergunta.
A ponte entre os dois: o que se quer é o mesmo — o que aconteceu na tela, em ordem, com hora, e com o que foi dito. Muda só quem lê no fim: um auditor ou um modelo.
Como funciona
Arraste o arquivo para a página. Ele é lido direto do seu disco — 300 MB ou 3 GB dá no mesmo, porque nada é enviado para lugar nenhum.
Transcreva ali mesmo, com o Whisper rodando na sua máquina, ou arraste uma legenda .vtt / .srt que você já tenha.
Revise os frames, descarte os ruins e baixe o documento. Junto vem o texto que explica ao modelo como ler aquele PDF — é isso que muda a qualidade da resposta.
Em vez de fotografar de dez em dez segundos, ele varre o vídeo e para nos instantes em que a tela realmente muda, com precisão de meio segundo. Numa apresentação, isso vira um frame por slide em vez de quarenta repetidos.
Cada tela leva o instante em que aconteceu. É o que separa uma pilha de prints de um documento que serve como evidência — e é o que deixa a IA citar o momento certo.
Não existe servidor. O vídeo, o áudio e a transcrição são processados no seu navegador — inclusive para gravações confidenciais de reunião.
O texto pronto instrui o modelo a citar os instantes, separar o que viu do que ouviu, e admitir quando a informação não está no documento em vez de inventar.
Privacidade
A maioria das ferramentas de vídeo online pede upload: seu arquivo vai para a máquina de alguém, é processado lá e fica armazenado por um tempo que você não controla. O Walkstamp não faz nada disso — a página é um arquivo estático, e todo o processamento acontece no seu navegador.
Não há conta, não há banco de dados, não há rastreamento. A única conexão externa é o download do modelo de transcrição, e apenas se você usar a transcrição automática. Leia a política completa.
Não. Abre no navegador e funciona. Chrome ou Edge atualizados dão a melhor experiência, porque a transcrição automática usa a placa de vídeo por meio do WebGPU.
Não há limite imposto por nós, justamente porque não há upload. O limite prático é a memória do seu computador. Vídeos longos levam mais tempo para varrer, e você pode interromper a varredura quando quiser.
MP4 (H.264), WebM e MOV na maioria dos casos. Formatos que o navegador não sabe decodificar — HEVC e alguns MKV — não abrem; nesses casos é preciso converter para MP4 antes.
Ela usa o Whisper rodando localmente. O modelo rápido é razoável e o mais preciso é bem melhor, às custas de um download maior. Se você já tem uma legenda gerada por outro serviço, pode arrastar o arquivo e pular essa etapa.
A ferramenta como está hoje é gratuita e o código é aberto sob licença MIT. Como não há custo de servidor, não há por que cobrar por ela.
Qualquer modelo que aceite anexos e leia imagens — Claude, ChatGPT e Gemini funcionam. Anexe o PDF e cole o prompt que a ferramenta gera junto.
Porque assistir e entender custam diferente. O Gemini amostra um quadro por segundo sem olhar o conteúdo: uma hora de vídeo são 3.600 imagens e perto de um milhão de tokens — o suficiente para encher a janela inteira e não sobrar espaço para a conversa. O mesmo material aqui sai em cerca de 60 telas e 60 mil tokens, porque as 3.540 restantes eram repetição. E o Claude e o ChatGPT continuam sem aceitar vídeo nenhum.