COMPARE/Markin vs um LLM conectado aos seus dados
vs um LLM com MCP: fazer perguntas não é gerir crescimento
+17–35% ARPU em relação ao holdoutIntervalo observado em implementações Markin, medido em coortes tratadas.
Um LLM com acesso MCP lê o seu warehouse e responde a perguntas sobre ele, de forma brilhante e económica. Markin executa o ciclo que vem após a resposta: avalia cada hipótese em dinheiro, testa-a contra um holdout aleatório e encaminha o trabalho entre modelos económicos, modelos de fronteira e machine learning clássico para que o raciocínio sobre milhões de clientes a cada semana seja economicamente possível.
Em resumo
- An LLM with MCP access: What is happening in my data, and what might explain it? Output: An explanation and a list of plausible recommendations.
- Markin: Which opportunity is worth acting on, for whom, and what did it actually return? Output: A sized, ranked action per customer, executed and measured.
- Plausível não é falsificável: nada numa resposta de chat estima o valor em risco ou a potência necessária para o detetar.
- Markin é o que se encontra entre a resposta e o dinheiro: uma biblioteca de skills que dimensiona, projeta, lança e lê, com a classe do modelo escolhida a cada passo para que a economia funcione à escala da população.
Última atualização: . As afirmações sobre outros fornecedores remetem para a fonte de onde provêm.
A resposta curtaÚltima atualização: August 2026
Esta é a alternativa real que a maioria das equipas pesa, e para exploração o LLM geralmente ganha. A diferença é o que acontece a seguir. Uma resposta de chat é plausível e infalsificável; a Markin transforma um candidate action numa hipótese dimensionada, um experimento com um grupo de controlo, e um número que as finanças aceitam. O custo é a razão pela qual a arquitetura subjacente não se parece em nada com um prompt.
01
Um LLM com acesso MCP
Um modelo de fronteira, ChatGPT, Claude ou Grok, com ferramentas sobre o seu warehouse, BI e sistemas de produtos através do Model Context Protocol. Lê, raciocina e explica a pedido.
Escolha-o quando o trabalho for entender o que aconteceu, elaborar uma análise ou desbloquear um analista em minutos.
- Respostas sob demanda
- Preço por token
- Sem grupo de controlo
02
Markin
Uma equipa autónoma de growth science. Habilidades versionadas geram, avaliam, projetam, lançam e leem hipóteses continuamente, usando a classe de modelo mais económica que pode realizar cada passo corretamente.
Escolha-o quando o trabalho for mover o ARPU em milhões de clientes e provar que o movimento foi incremental.
- Decisões, não respostas
- Holdout em tudo
- Pilha de modelos roteada
Linha por linha
As mesmas dez perguntas, respondidas para ambos.
| Dimensão | Markin | Um LLM com acesso MCP |
|---|---|---|
| O que é | Uma equipa autónoma de growth-science: investiga por que a receita por cliente está estagnada e age sobre o que encontra. | Um modelo de raciocínio geral com acesso de leitura aos seus sistemas através de servidores MCP. |
| O que decide | Que oportunidade comercial merece existir para cada cliente esta semana, qual o seu valor, e quando a resposta certa é não fazer nada. | Nada por si só. Propõe; um humano decide, orienta e constrói. |
| De onde vêm as hipóteses | Gerado por Markin a partir de dados de cliente, produto, preço e saúde técnica, depois dimensionado antes que alguém construa algo. | Gerado a pedido, na direção apontada pelo prompt, sem memória do que já foi tentado. |
| Como uma hipótese é avaliada | Dimensionado em dinheiro na população elegível, filtrado por poder estatístico, depois eliminado ou mantido por um holdout aleatório. | Julgado pela convicção da explicação. Nada dimensiona a ideia em dinheiro nem verifica se alguma vez poderia atingir significância. |
| Âmbito de ação | Hipóteses de marketing, produto, preços e saúde técnica, arbitradas entre si numa única fila. | Tão ampla quanto as ferramentas que lhe são dadas, mas sempre terminando numa recomendação numa janela de chat. |
| Que modelos fazem o trabalho | Uma mistura roteada: modelos de linguagem de ponta para escrever e explicar, modelos pequenos e baratos para classificação de volume, e ML clássico e deep learning, uplift, survival, séries temporais, embeddings, para os números. | Um modelo de fronteira para cada etapa, quer a etapa precise de raciocínio ou não. |
| Com o que os custos escalam | Decisões tomadas e receita comprovada, não tokens queimados. O raciocínio por cliente é tratado pelas camadas baratas por design. | Tokens consumidos. Raciocinar sobre cada cliente semanalmente com base em dezenas de milhões não é um problema de preço, é uma impossibilidade. |
| Como o trabalho chega ao cliente | Escrito de volta nos sistemas que já executa, como atributos, eventos ou chamadas de API. Markin não adiciona uma nova superfície voltada para o cliente. | Um humano lê a resposta e faz o trabalho noutro sistema. |
| Como o impacto é comprovado | Um holdout aleatório em cada decisão. O número reportado é receita incremental e ARPU, não conversões atribuídas. | O que o analista configurar depois, geralmente atribuição em vez de um holdout. |
| Onde os dados residem | Lê o contexto onde já reside, warehouse, CDP, sistemas de produto e faturação. Nenhum novo sistema de registo. | O seu armazém e ferramentas, acedidos ao vivo através de servidores MCP que hospeda e protege. |
| Governança e controlo | Cada ação tem a sua hipótese, o seu valor esperado, as suas salvaguardas e o seu control group, passíveis de revisão antes do lançamento. | Permissões de prompt e ferramenta. Sem registo do porquê de uma dada recomendação ter sido feita ou qual o seu valor. |
| Tempo até um número verificado | Um tema de receita, um canal, um holdout: um número incremental defensável em 90 dias. | Minutos para uma resposta. O relógio para um número verificado ainda não começou. |
| Melhor ajuste | Grandes bases B2C onde a restrição é o número de boas hipóteses testadas, não o número de mensagens enviadas. | Analistas e operadores que precisam de entender o negócio mais rapidamente. |
O que está em jogo
Uma camada de decisioning não é um item de linha de ferramenta. Ela movimenta o ARPU na base total, todos os meses.
Base instalada
2.0M
customers at $24 ARPU / month
Receita endereçável
$259.2M
por ano, base alcançável
Aumento de ARPU verificado
+17% a +35% ARPU
em coortes tratadas, contra holdout
O que isso vale
$44.1M – $90.7M
receita incremental por ano
Medido em coortes tratadas contra um holdout aleatório, lido durante uma janela de medição completa em vez das primeiras semanas. Intervalo anonimizado em implementações Markin em grandes bases B2C; o seu próprio holdout é o número que decide. As figuras acima aplicam essa faixa à parcela alcançável da base, com base nas premissas desta página; elas são aritméticas, não uma previsão para o seu negócio.
Execute-o com os seus próprios númerosA parte não resolvida
O que ainda falta quando o modelo consegue ler tudo
O acesso nunca foi a parte difícil. A parte difícil é transformar uma declaração plausível numa decisão que seja acessível para ser tomada cem milhões de vezes, e num número que resista a ser questionado.
- Plausível não é falsificável: nada numa resposta de chat estima o valor em risco ou a potência necessária para o detetar.
- Nenhuma memória do método: a mesma pergunta feita duas vezes pode produzir duas recomendações incompatíveis.
- O custo escala com a curiosidade, não com a receita, pelo que o raciocínio por cliente permanece fora de alcance.
- Sem grupo de controlo, portanto cada vitória reportada herda o problema de atribuição que você já tem.
Espaço de hipóteses
Tudo o que um cientista de crescimento humano analisaria.
A maioria dos problemas de crescimento não são problemas de mensagem. Markin não está restrito à superfície da campanha: se algo está a impedir o ARPU de crescer, está dentro do âmbito e é testado da mesma forma.
Marketing
A superfície clássica, mas escolhida por cliente em vez de por segmento, e sempre contra um holdout.
- Que oferta este cliente específico vale a pena fazer
- Channel e tempo escolhidos por pessoa, não por campanha
- Pressão de contacto e fadiga arbitradas em todos os programas
- Economia de recuperação: quem merece um desconto e quem não
Produto
Onde o cliente realmente experimenta o valor, e onde a maior parte da perda de receita silenciosa acontece.
- Etapas de onboarding que perdem clientes antes do primeiro valor
- Uma funcionalidade com alta correlação de retenção que metade da base nunca descobre.
- Posicionamento do Paywall e do prompt de upgrade
- Interfaces no produto usadas como grupo de tratamento, não apenas e-mail e push
Comercial
Preços, embalagem e a forma da própria oferta, testados em vez de discutidos.
- Estrutura do plano e do pacote por coorte
- Profundidade de desconto em relação à margem, não apenas à conversão
- Estruturação anual versus mensal por cliente
- Sequências de recuperação de cobrança e churn involuntário
Saúde técnica
Anomalias que ninguém pediu para procurar. Esta é a categoria que nenhum motor de decisão cobre.
- Uma taxa de erro de checkout que aumentou num dispositivo e numa região.
- Falhas de pagamento concentradas num único emissor ou método
- Um deeplink quebrado a matar silenciosamente uma jornada de alto valor
- Latência ou degradação da entrega a consumir a conversão antes de qualquer mensagem
Pense na Markin como uma equipa de data science e growth que nunca dorme: investiga, forma hipóteses, implementa-as no seu próprio stack e prova cada uma contra um grupo de controlo, num volume que nenhuma equipa humana pode alcançar.
Job to be done
O mesmo trabalho, com um rendimento diferente.
Nada do que se segue precisa de uma ferramenta que não existe. Precisa que o trabalho aconteça continuamente em vez de uma vez por trimestre, e que seja comprovado contra um holdout em vez de ser discutido.
| Job to be done | With An LLM with MCP access alone | Com Markin |
|---|---|---|
| Observe que a receita por cliente está a desviar num segmento | Alguém percebe isso numa revisão de dashboard, semanas depois de ter começado. | Detetado como um sinal no dia em que o drift elimina o ruído, com o segmento já dimensionado. |
| Explicar porque está a acontecer | Um analista é retirado do roadmap para uma investigação de duas semanas. | Uma investigação é executada automaticamente e retorna os *drivers* com as suas evidências. |
| Crie hipóteses que valham a pena testar | Um workshop produz o punhado de ideias que a sala teve por acaso. | As hipóteses são escritas continuamente em marketing, produto, precificação e saúde técnica. |
| Decidir quais hipóteses merecem orçamento | Priorizado por senioridade e intuição, sem tamanho anexado. | Cada um é dimensionado em receita e classificado antes que algo seja construído. |
| Escolha o Next Best Action para um cliente | As regras do Segment e os calendários de campanhas decidem, atualizados quando alguém tem tempo. | Escolhido por cliente, por momento, contra tudo o resto que compete por esse cliente. |
| Lançar de facto | Um ticket para a equipa de ciclo de vida e, em seguida, um lugar no calendário do próximo mês. | Executado dentro dos sistemas que já utiliza, sem um novo canal para adotar. |
| Comprovar que causou a receita | Reportado contra não-qualificados ou um holdout global, se tanto. | Cada decision tem um control group aleatório; o uplift é lido em relação a ele. |
| Mata o que não funciona | Os programas sobrevivem porque ninguém se encarrega de os descontinuar. | Falhar em superar o controlo desativa o programa automaticamente. |
| Fazer tudo de novo na próxima semana | Com capacidade limitada: de quatro a oito testes por trimestre. | Centenas de hipóteses em andamento em paralelo, continuamente. |
Opinião honesta
O quê Um LLM com acesso MCP faz melhor.
Uma comparação que apenas lisonjeia um lado não vale a pena ser lida. Estes são os casos em que lhe diríamos para ficar onde está.
Para exploração, o LLM é melhor e muito mais barato
Se a questão é o que aconteceu na semana passada, por que um coorte se moveu ou como escrever uma consulta, um LLM com MCP supera qualquer plataforma em velocidade e custo. Usamos exatamente isso internamente e ninguém deveria comprar software para substituí-lo.
O ecossistema MCP está a mover-se rapidamente
Alguns dos “canos” que construímos hoje, acesso a ferramentas, conhecimento de esquemas, caminhos de leitura seguros, serão commodity. A parte que não se tornará commodity é a disciplina experimental: dimensionamento, poder estatístico, holdouts e desativação.
Uma base pequena não precisa de nada disto.
Abaixo de algumas centenas de milhares de clientes, um bom analista com um modelo de fronteira e acesso a warehouse superará um sistema autónomo, porque não há população suficiente para alimentar os experimentos dos quais Markin depende.
Modelos gerais raciocinam melhor em aberto
Diante de uma pergunta nova e não estruturada, um modelo de fronteira com ferramentas é mais flexível do que qualquer biblioteca de skills. O Markin é mais específico de propósito: troca a amplitude pela reprodutibilidade.
Onde a Markin se encaixa
Não é um substituto. Uma equipa de growth-science no topo.
Markin é o que se encontra entre a resposta e o dinheiro: uma biblioteca de skills que dimensiona, projeta, lança e lê, com a classe do modelo escolhida a cada passo para que a economia funcione à escala da população.
Competências, não prompts
Deteção de anomalias, avaliação, design de experimentos, leitura de holdout e arbitragem são componentes versionados com as suas próprias avaliações.
O encaminhamento do modelo é uma decisão de custo
Modelos de ponta onde a linguagem agrega valor; modelos pequenos para volume; ML clássico e deep learning onde o número tem de ser defensável.
Cada reivindicação carrega um control group
A saída é ARPU incremental, não um parágrafo convincente.
Porque a Markin ganha
Mais poderoso do que qualquer coisa nesta página.
Cada ferramenta com a qual a Markin é comparada foi construída para uma tarefa que termina antes que a receita se mova: entregar a mensagem, unificar os dados, pontuar o lead. A Markin foi construída para um único resultado, aumentar o ARPU, e possui o ciclo completo que leva a isso: investigar, hipotetizar, lançar, medir e escalar, em marketing, produto, preços e saúde técnica.
Aprendizagem ultrarrápida, por design
A Markin Growth Science executa o ciclo completo de observar, criar uma hipótese, fazer um experimento e ler em dias, com centenas de experimentos com holdout em paralelo. O sistema acumula aprendizagem a um ritmo que nenhuma equipa humana, e nenhuma ferramenta de campanha, consegue igualar.
growth operations, eficientes
A quantificação, o design do segmento, a construção, o lançamento e a medição costumavam ser quatro equipas e um sprint. Na Markin, são um único sistema, para que a mesma growth operation envie mais ações de receita com uma fração do custo de coordenação.
Um resultado: ARPU
Cada hipótese é dimensionada em receita esperada por cliente, cada ação é julgada contra um holdout aleatório, e tudo o que supera o controlo escala automaticamente pela base. Nada mais nesta página é medido dessa forma.
Se o objetivo é aumentar o ARPU através de um aprendizado ultrarrápido e executar growth operations de forma mais eficiente, a escolha é a Markin.
Padrão de evidência
A maior parte desta categoria reporta o seu próprio lift.
Nenhum dos principais fornecedores de engajamento, CDP ou personalização publica um valor de uplift verificado independentemente para o seu produto de decisão. Onde existem números, estes provêm de estudos encomendados por fornecedores ou estudos de caso de um único cliente sem metodologia de holdout divulgada. A pesquisa pública mais rigorosa na categoria não é lisonjeira para ninguém, incluindo nós, e é exatamente por isso que construímos contra ela.
A BCG relata que, quando as organizações adotam testes de incrementalidade rigorosos, normalmente descobrem que 20% a 40% dos seus programas ativos de Next Best Action geram um retorno marginal a negativo.
Pesquisa independenteBCG, Como a Medição Está a Evoluir no Next Best Action (2026)A mesma pesquisa assinala efeitos de novidade, novos programas mostram resultados iniciais inflacionados, e recomenda 8 a 12 semanas antes de tirar conclusões.
Pesquisa independenteBCG, Como a Medição Está a Evoluir no Next Best Action (2026)Medições de ROI a nível de programa e de global-holdout frequentemente superestimam o impacto através de efeitos de halo, pull-forward effects e contaminação de experimento.
Pesquisa independenteBCG, Como a Medição Está a Evoluir no Next Best Action (2026)
Como a Markin se compromete
- Cada decision que o Markin toma tem um control group. O uplift é reportado em relação a esse holdout, não em relação aos clientes que não se qualificaram.
- Os resultados são lidos durante uma janela de medição completa, em vez de nas primeiras semanas, para que a novidade não seja confundida com o efeito.
- Os programas que não conseguem superar o controlo são descontinuados automaticamente. Terminar decisões que não compensam faz parte do ciclo, não de uma revisão anual.
- O único número que citamos sobre nós é uma gama, não uma média: +17% a +35% ARPU em coortes tratadas contra um holdout aleatório, em implementações Markin em grandes bases B2C. Não publicamos nenhum benchmark da indústria, porque não conseguimos encontrar um que estivéssemos dispostos a defender. O seu holdout é o número que importa.
Time to value
90 dias para um número que sobreviveu a um holdout.
Nenhum replatform, nenhuma migração de dados, nenhuma reconstrução dos canais que já opera. Se as primeiras cohorts não superarem o controlo, nada escala e perdeu um trimestre, não um roadmap.
Semanas 0–2
Leia o contexto que já possui
A Markin conecta-se aos dados e aos canais que você utiliza atualmente, incluindo o An LLM with MCP access. Sem migração, sem replatform, sem nova fonte de verdade.
Semanas 3–6
Primeiras oportunidades dimensionadas em teste
As Oportunidades são classificadas por valor esperado, os tratamentos são escolhidos por cliente, e as primeiras coortes são lançadas com um holdout randomizado anexado.
Semanas 7–12
Primeira receita incremental verificada
Os resultados são lidos durante uma janela de medição completa. O que supera o controlo é escalado; o que não supera é retirado. Nada é escalado com base num número que não sobreviveu a um holdout.
Qual você deve escolher.
Escolha Markin se
- Precisa de uma decisão por cliente por semana, não de uma resposta por pergunta.
- O número tem de sobreviver a um holdout aleatório e a uma revisão financeira.
- A base é grande o suficiente para que ideias não testadas custem dinheiro real.
- O raciocínio por cliente tem que ser acessível a dezenas de milhões de registos.
- Quer que o método seja versionado e repetível, não re-prompted de cada vez.
Escolha um LLM com MCP if
- O trabalho é de exploração, diagnóstico ou elaboração.
- Os seus analistas são o gargalo e querem alavancagem, não autonomia.
- Você ainda não está pronto para executar experimentos controlados na base.
- A base é pequena o suficiente para que o julgamento supere os testes.
- Quer começar esta semana com ferramentas pelas quais já paga.
Quando não precisa de Markin.
- Quer uma interface de chat sobre o seu armazém: use um LLM com MCP, é a ferramenta certa.
- A base é demasiado pequena para medições controladas.
- Não há apetite para agir automaticamente em nada, mesmo sob salvaguardas.
Ver no produto
Veja-o decidir, experimentar e executar, antes de falar com alguém.
Um tour guiado pelo workspace Markin num cliente demo, sem call de vendas, sem configuração.
Perguntas que os compradores fazem.
Por que não podemos simplesmente conectar o ChatGPT ou Claude ao nosso warehouse com MCP?
Você pode, e deve, para análise. O que não fará é decidir o que cada um dos dez milhões de clientes deve receber esta semana, dimensionar essas decisões em dinheiro e provar o resultado contra um grupo de controlo. Esses passos precisam de um método versionado e um custo de execução que não escala com tokens.
A Markin não é apenas um LLM com melhores prompts?
Não. Os modelos de linguagem são uma de várias camadas, usados onde a linguagem realmente ajuda: a escrever hipóteses, a explicar descobertas, a redigir briefings. O scoring, uplift modelling, survival analysis e anomaly detection que produzem os números são machine learning clássico e deep learning, e a maioria do trabalho por cliente nunca chega a tocar num modelo de fronteira.
Como é que o custo se compara?
Unidade completamente diferente. Um LLM com MCP tem o preço por pergunta feita. A economia de Markin é construída em torno das decisões tomadas, e é por isso que modelos baratos e modelos treinados fazem o trabalho de volume, e o raciocínio caro é reservado para os poucos passos onde altera o resultado.
O que impede um LLM de produzir boas hipóteses?
Nada. Produz bastante, e alguns são bons. O problema é que não consegue dizer quais valem o custo de oportunidade, se a população elegível é grande o suficiente para detetar o efeito, ou se a mesma ideia falhou há dois trimestres.
Vocês usam MCP internamente?
Sim. O acesso a ferramentas de sistemas é um canal útil e tratamo-lo como tal. É uma transport layer, não um programa de crescimento.
Em que é que a Markin é diferente do decisioning ou da AI já existentes no An LLM with MCP access?
Um motor de decisioning classifica as ações que um humano já definiu, dentro da superfície de campanha que lhe foi dada. A Markin forma as hipóteses por si mesma, marketing, produto, preço ou uma anomalia técnica que esteja a atrasar o growth, dimensiona-as, executa-as dentro do An LLM with MCP access e das suas superfícies de produto, e lê cada uma contra um holdout aleatório. Comporta-se como uma equipa de data science e growth, e não como um otimizador.
O Markin testa apenas mensagens e ofertas?
Não. Tudo o que um growth scientist humano investigaria está dentro do âmbito: fricção no onboarding, adoção de funcionalidades, precificação e empacotamento, cobrança e problemas de saúde técnica, como uma taxa de erro no checkout ou um deeplink quebrado que silenciosamente está a matar a conversão. Marketing é um dos quatro domínios de hipóteses, não o limite.
O que é the business case for adding Markin on top of An LLM with MCP access?
On a large B2C base, um pequeno movimento no ARPU representa um grande número em termos absolutos, porque se aplica a toda a base instalada todos os meses, e não a uma campanha. Nos deployments da Markin, o intervalo verificado em coortes tratadas é de +17% a +35% ARPU contra um holdout aleatório. O objetivo não é ter mais mensagens: é encontrar a ação de maior valor por cliente, lançá-la e comprová-la contra o controlo antes de dimensionar.
Quanto tempo até se pagar?
As primeiras oportunidades dimensionadas estão em teste dentro de seis semanas e o primeiro resultado holdout-verified chega dentro de 90 dias. O payback depende da sua base, margem e custo do programa, a calculadora nesta página calcula-o a partir dos seus próprios números, após aplicar o haircut de 20% a 40% que a BCG encontra quando os programas de next-best-action são incrementality-tested.
Ler a seguir
Leitura de fundo sobre como funciona o decisioning de next best action, dos guias por trás desta comparação.
Next best action marketing: o que é e como funciona em 2026
Next best action marketing explicado: como funciona, exemplos reais B2C, como difere das campanhas de segmento e da marketing automation, e quanto vale numa base de 2M.
Agentes na web aberta: navegação dentro de um ciclo de decisão
Uma taxonomia de navegação agêntica, os modos de falha em que passámos mais tempo e resultados empíricos de seis ambientes de trabalho enterprise medidos em comparação com um holdout preservado.
Einstein Next Best Action: como funciona, limites e a camada de decisão
Como o Strategy Builder classifica as recomendações no Salesforce, onde o padrão para, e como decidir no warehouse e entregar dentro do CRM.