Código aberto · Apache-2.0

IA que roda
no seu navegador

Converse com modelos Apertus (Swiss AI) sem servidores, sem custos e com privacidade total. Os pesos ficam em cache no seu próprio dispositivo.

Sem cadastro. Sem cartão. Roda via WebGPU no Chrome / Edge.

Tecnologia por baixo do capô

Impacto

Privacidade por design

Nada sai do seu dispositivo. Nada chega a nenhum servidor.

100%
Privado — conversa não sai do navegador
0 srv
Servidores de IA envolvidos
4k tok
Janela de contexto por conversa
3 mod
Modelos Apertus disponíveis (0.5B–4B)
Funcionalidades

Tudo que você precisa,
sem nada que não precisa

🔐

Privacidade real

Os modelos rodam inteiramente no seu GPU via WebGPU. Suas mensagens nunca saem do seu dispositivo — sem logs, sem analytics de conversa, sem serviço de terceiros.

webgpu detected
model loaded from cache
inference running locally
→ 0 requests to remote servers

WebGPU nativo

Inferência diretamente na GPU do dispositivo. Download único, cache no navegador — nas próximas visitas carrega em segundos.

📦

ONNX/INT4

Pesos quantizados em 4 bits no formato ONNX. Máxima compatibilidade com mínimo uso de memória.

🌐

Multilíngue

Apertus é treinado com dados em múltiplos idiomas, incluindo português. Responde no idioma que você usar.

🔧

Configurável

Ajuste temperatura, top-p, penalidade de repetição e tamanho da resposta diretamente no painel.

Modelos

Escolha o modelo certo

Todos da família Apertus (Swiss AI Initiative), abertos, Apache-2.0. O 0.5B baixa primeiro para uma entrada rápida; o 1.5B é ativado em seguida.

Apertus 0.5B

O mais leve. Sobe rápido e serve para conversas simples. Baixado automaticamente na primeira visita.

0.5B params ~380 MB 4096 ctx INT4
Usar agora →

Apertus 1.5B

Recomendado

Melhor equilíbrio entre qualidade e tamanho. Modelo padrão do MouseBox, ativado automaticamente após o 0.5B.

1.5B params ~1.1 GB 4096 ctx INT4
Usar agora →

Apertus 4B

Mais poderoso. Requer GPU com bastante memória (~4–6 GB VRAM). Indicado para respostas mais elaboradas.

4B params ~2.6 GB 4096 ctx INT4
Usar agora →
Como funciona

Três passos, zero servidores

Abre o chat

O navegador verifica se WebGPU está disponível e inicia o download automático do modelo leve (0.5B).

Modelo carrega na GPU

Os pesos ONNX/INT4 são carregados diretamente na GPU via WebGPU. Na segunda visita, sai do cache — sem nova rede.

Conversa localmente

Tokens gerados em streaming direto no seu dispositivo. Histórico salvo em localStorage, configurações ajustáveis.

Experimente agora,
sem cadastro

Abra o chat, aguarde o modelo carregar uma vez, e comece a conversar com IA local e privada.