Experimento público · 2ª marca-lab
Roboxy: 68% do que as IAs disseram sobre a marca era invenção
Segunda marca real usada como laboratório do método GenOpt. Baseline medido em 07/08/2026, intervenção AEO aplicada no mesmo dia, re-scans agendados. Cada número desta página tem data — e o achado mais interessante está registrado como hipótese, não como vitória.
68%
das menções eram confabulação (17 de 25) — medição de 07/08/2026
7/7
engines que mencionaram a marca confabularam em 07/08/2026
0%
de citação nas perguntas de categoria (75 respostas, todas ABSENT)
O baseline de 07/08/2026, resposta por resposta
120 execuções (15 prompts × 8 engines, 113 válidas), classificadas nas 5 classes do ADR-031. Cada execução guarda a resposta bruta e o hash — nada abaixo é estimativa.
| Classe | Runs | O que significa |
|---|---|---|
| ABSENT | 88 | a IA não mencionou a marca |
| CONFABULATED | 17 | mencionou e inventou — não bate com fatos com fonte |
| DESCRIPTIVE | 5 | descreveu com base em fatos verificáveis |
| ECHO | 2 | só repetiu o nome que o prompt deu |
| STRONG | 1 | citou o site da marca como fonte |
// scan de 07/08/2026 ~15:05 UTC · 113 runs classificados de 120 · custo medido US$ 2,31
Quem confabulou
Das 25 respostas que mencionaram o Roboxy, 17 afirmaram coisas que não batem com fatos verificáveis sobre a marca — funcionalidades e natureza do produto inventadas. Todos os engines que falaram da marca inventaram algo:
- Claude3 confabuladas
- Gemini3 confabuladas
- Grok3 confabuladas
- DeepSeek3 confabuladas
- Perplexity2 confabuladas
- ChatGPT2 confabuladas
- Google AI Mode1 confabulada
O primeiro STRONG do laboratório — registrado como hipótese
Hipótese · aguardando re-scans de 08/08, 10/08 e 14/08 às 16:30 UTC
Em 07/08/2026 (~15:05–15:15 UTC), o Grok respondeu a um prompt DEFENSIVE — sobre segurança e privacidade do produto — citando o próprio roboxy.ai. É a primeira citação com URL em 458 runs classificados entre as duas marcas-lab desde 06/08/2026. O site tinha sido pré-renderizado ~30 minutos antes, e o Grok tem busca em tempo real; a explicação é plausível. Mas correlação temporal não é causalidade: sem baseline do site vazio, isso fica registrado como hipótese até os re-scans — e será publicado igualmente se for refutado.
Linha do tempo do experimento
07/08 ~14:45 UTC
Pré-render do site
roboxy.ai sai de 35 para 270 palavras no HTML servido; robots.txt, llms.txt e sitemap.xml criados (eram 404).
07/08 ~15:05 UTC
Baseline
120 runs (15 prompts × 8 engines), 113 classificados e 7 falhas. Custo medido: US$ 2,31. Nota metodológica: o baseline já mede o site COM o pré-render — não existe medição do site vazio, então o efeito do pré-render em si não é atribuível.
07/08 15:30 UTC (T+0)
Intervenção AEO
3 artigos publicados em roboxy.ai/blog (1.455–1.674 palavras cada, com FAQ e Schema) e submissão IndexNow aceita (HTTP 202).
08/08, 10/08 e 14/08 às 16:30 UTC
Re-scans agendados
Três medições fora do TTL de cache dos engines. São elas que vão confirmar ou refutar a hipótese do STRONG abaixo.
Comparado com o IPNotary
A primeira marca-lab, o IPNotary, teve ~35% de confabulação sobre menções (37/106) na medição de 06–07/08/2026. O Roboxy quase dobra a taxa: 68%. A leitura que emerge — quanto menor a pegada pública da marca, maior a fração de invenção — está registrada como observação com N=2, não como lei. As perguntas de categoria deram 0% de citação nas duas marcas.
Aviso de reprodutibilidade
Respostas de IA mudam; os números desta página refletem a medição da data indicada em cada um. Cada execução guarda a resposta bruta e o hash SHA-256 — evidências individuais podem ser conferidas publicamente em /verify.
Perguntas frequentes
- O que é o Roboxy neste experimento?
- A segunda marca-laboratório do GenOpt: uma marca real, pequena e recente, usada como cobaia pública do método. O baseline foi medido em 07/08/2026 (120 runs, 15 prompts em 8 engines) e cada número da página carrega essa data.
- O que significa "68% de confabulação"?
- Das 25 respostas que mencionaram o Roboxy no baseline de 07/08/2026, 17 foram classificadas como CONFABULATED — afirmações que não batem com fatos verificáveis sobre a marca. Todos os 7 engines que mencionaram a marca confabularam.
- O Grok citou o site da marca. Isso prova que a intervenção funcionou?
- Não — e é por isso que está registrado como hipótese. O pré-render do site foi publicado cerca de 30 minutos antes do scan, então a atribuição é plausível mas não provada. Os re-scans de 08/08, 10/08 e 14/08/2026 vão confirmar ou refutar, e publicaremos o resultado nos dois casos.
- Esses números valem para sempre?
- Não. Respostas de IA mudam; os números refletem a medição da data indicada. É exatamente por isso que cada medição publica data, arquivo de origem e classificação por resposta.