Experimento público · 2ª marca-lab

Roboxy: 68% do que as IAs disseram sobre a marca era invenção

Segunda marca real usada como laboratório do método GenOpt. Baseline medido em 07/08/2026, intervenção AEO aplicada no mesmo dia, re-scans agendados. Cada número desta página tem data — e o achado mais interessante está registrado como hipótese, não como vitória.

68%

das menções eram confabulação (17 de 25) — medição de 07/08/2026

7/7

engines que mencionaram a marca confabularam em 07/08/2026

0%

de citação nas perguntas de categoria (75 respostas, todas ABSENT)

O baseline de 07/08/2026, resposta por resposta

120 execuções (15 prompts × 8 engines, 113 válidas), classificadas nas 5 classes do ADR-031. Cada execução guarda a resposta bruta e o hash — nada abaixo é estimativa.

ClasseRunsO que significa
ABSENT88a IA não mencionou a marca
CONFABULATED17mencionou e inventou — não bate com fatos com fonte
DESCRIPTIVE5descreveu com base em fatos verificáveis
ECHO2só repetiu o nome que o prompt deu
STRONG1citou o site da marca como fonte

// scan de 07/08/2026 ~15:05 UTC · 113 runs classificados de 120 · custo medido US$ 2,31

Quem confabulou

Das 25 respostas que mencionaram o Roboxy, 17 afirmaram coisas que não batem com fatos verificáveis sobre a marca — funcionalidades e natureza do produto inventadas. Todos os engines que falaram da marca inventaram algo:

  • Claude3 confabuladas
  • Gemini3 confabuladas
  • Grok3 confabuladas
  • DeepSeek3 confabuladas
  • Perplexity2 confabuladas
  • ChatGPT2 confabuladas
  • Google AI Mode1 confabulada

O primeiro STRONG do laboratório — registrado como hipótese

Hipótese · aguardando re-scans de 08/08, 10/08 e 14/08 às 16:30 UTC

Em 07/08/2026 (~15:05–15:15 UTC), o Grok respondeu a um prompt DEFENSIVE — sobre segurança e privacidade do produto — citando o próprio roboxy.ai. É a primeira citação com URL em 458 runs classificados entre as duas marcas-lab desde 06/08/2026. O site tinha sido pré-renderizado ~30 minutos antes, e o Grok tem busca em tempo real; a explicação é plausível. Mas correlação temporal não é causalidade: sem baseline do site vazio, isso fica registrado como hipótese até os re-scans — e será publicado igualmente se for refutado.

Linha do tempo do experimento

  1. 07/08 ~14:45 UTC

    Pré-render do site

    roboxy.ai sai de 35 para 270 palavras no HTML servido; robots.txt, llms.txt e sitemap.xml criados (eram 404).

  2. 07/08 ~15:05 UTC

    Baseline

    120 runs (15 prompts × 8 engines), 113 classificados e 7 falhas. Custo medido: US$ 2,31. Nota metodológica: o baseline já mede o site COM o pré-render — não existe medição do site vazio, então o efeito do pré-render em si não é atribuível.

  3. 07/08 15:30 UTC (T+0)

    Intervenção AEO

    3 artigos publicados em roboxy.ai/blog (1.455–1.674 palavras cada, com FAQ e Schema) e submissão IndexNow aceita (HTTP 202).

  4. 08/08, 10/08 e 14/08 às 16:30 UTC

    Re-scans agendados

    Três medições fora do TTL de cache dos engines. São elas que vão confirmar ou refutar a hipótese do STRONG abaixo.

Comparado com o IPNotary

A primeira marca-lab, o IPNotary, teve ~35% de confabulação sobre menções (37/106) na medição de 06–07/08/2026. O Roboxy quase dobra a taxa: 68%. A leitura que emerge — quanto menor a pegada pública da marca, maior a fração de invenção — está registrada como observação com N=2, não como lei. As perguntas de categoria deram 0% de citação nas duas marcas.

Aviso de reprodutibilidade

Respostas de IA mudam; os números desta página refletem a medição da data indicada em cada um. Cada execução guarda a resposta bruta e o hash SHA-256 — evidências individuais podem ser conferidas publicamente em /verify.

Perguntas frequentes

O que é o Roboxy neste experimento?
A segunda marca-laboratório do GenOpt: uma marca real, pequena e recente, usada como cobaia pública do método. O baseline foi medido em 07/08/2026 (120 runs, 15 prompts em 8 engines) e cada número da página carrega essa data.
O que significa "68% de confabulação"?
Das 25 respostas que mencionaram o Roboxy no baseline de 07/08/2026, 17 foram classificadas como CONFABULATED — afirmações que não batem com fatos verificáveis sobre a marca. Todos os 7 engines que mencionaram a marca confabularam.
O Grok citou o site da marca. Isso prova que a intervenção funcionou?
Não — e é por isso que está registrado como hipótese. O pré-render do site foi publicado cerca de 30 minutos antes do scan, então a atribuição é plausível mas não provada. Os re-scans de 08/08, 10/08 e 14/08/2026 vão confirmar ou refutar, e publicaremos o resultado nos dois casos.
Esses números valem para sempre?
Não. Respostas de IA mudam; os números refletem a medição da data indicada. É exatamente por isso que cada medição publica data, arquivo de origem e classificação por resposta.