Terug naar blog
AI-onderzoek

Waarom 'AI in jouw merkstem' moeilijker is dan het klinkt — en hoe de goede systemen het echt doen

De meeste AI-supporttools beweren dat ze in jouw merkstem antwoorden. Heel weinig doen dat echt. Waarom de technische uitdaging groter is dan ze lijkt, wat fine-tuning verandert, en de blinde test die echte merkstem onderscheidt van het invoegen van een merknaam.

Respondo Team10 augustus 20267 min lezen

Belangrijkste punten

  • Merkstem is meer dan woordkeuze. Het is tempo, formaliteit, warmte, humor, hoe je spanning oplost en de balans tussen autoriteit en empathie. Eén van die dingen fout doen maakt de AI al vreemd.
  • LLM's vallen standaard terug op een neutrale, zakelijke stem. Die standaard overschrijven met prompts is fragiel — kleine verschillen in klantvragen leveren een inconsistente stem op.
  • Fine-tuning op je werkelijke supportgeschiedenis is het verschil tussen 'AI die je merknaam noemt' en 'AI die klinkt alsof je team het schreef'. De meeste leveranciers doen dit niet.
  • De test is blind lezen: haal 20 antwoorden van je AI en 20 van je menselijke agents op. Als een buitenstaander kan zien welke welke is, is je merkstem er nog niet.

Elke leverancier van AI-support belooft dat de AI klinkt zoals jij. De demo toont een antwoord op vriendelijke toon met jouw bedrijfsnaam erin. De klant knikt. Deal gesloten. AI gaat naar productie.

Zes maanden later maakt iemand een screenshot van een AI-antwoord dat zegt: 'Ik begrijp je frustratie en waardeer je geduld terwijl we hier samen doorheen werken.' Het belandt op Twitter. Het bedrijf dat jaren heeft gewerkt aan een stem van droge deskundigheid, staat er ineens bij als een callcenter.

Dit is wat er gebeurt wanneer AI-systemen merkstem verwarren met het invoegen van een merknaam.

Echte merkstem is subtiel. Ze zit net zo goed in wat je niet zegt als in wat je wel zegt. Een tech-gedreven merk laat beleefdheden als 'alsjeblieft' en 'dank je wel' misschien weg omdat ze frictie toevoegen. Een merk dat draait om gastvrijheid doet precies het omgekeerde. Een devtool-bedrijf gebruikt technisch jargon omdat klanten die taal spreken. Een consumentenmerk vermijdt het juist consequent.

Dit goed krijgen in AI-antwoorden is oprecht moeilijk. De meeste leveranciers krijgen het niet goed. En de meeste klanten weten het pas als ze diep in productie zitten en de klachten binnenkomen.

Waar merkstem echt uit bestaat

Zes dimensies bepalen of AI-antwoorden klinken als jouw merk.

Formaliteitsregister. Hoe formeel of informeel is de taal? 'Hoi!' of 'Geachte klant'? Jij of u? Emoji of niet? Merken zitten op heel verschillende punten op deze as.

Warmtesignalen. Hoeveel erkent de tekst emotie? Een supportstem die elk bericht opent met 'Ik begrijp het helemaal' leest als een script. Een stem die gevoelens nooit benoemt, leest als kil. Het juiste niveau is merkspecifiek.

Directheid. Komt je merk meteen ter zake, of bouwt het ernaartoe? 'Je abonnement wordt op 5 maart verlengd' is iets anders dan 'Ik wilde even contact opnemen over je aankomende verlenging — je abonnement wordt op 5 maart verlengd.' Dezelfde informatie, een andere stem.

Autoriteitsniveau. Presenteert het merk zich als expert die de gebruiker begeleidt, als collega die een collega helpt, of als bescheiden dienstverlener? Dat zie je terug in formuleringen als 'De beste aanpak is...' versus 'Je zou kunnen proberen...' versus 'Laten we het samen uitzoeken.'

Humor en speelsheid. Sommige merken kunnen luchtig en af en toe grappig zijn. Bij andere zou dat volkomen verkeerd klinken. De standaard van AI is meestal vlakke neutraliteit — geen humor, in geen enkele richting — wat voor beide uitersten net verkeerd klinkt.

Omgaan met slecht nieuws. Hoe brengt jouw merk 'nee' of 'dat kunnen we niet'? Het sjabloon-AI-antwoord is gebufferd met empathie: 'Ik begrijp helemaal dat dit niet is wat je hoopte te horen, maar helaas...' Sommige merken doen precies dit. Andere zeggen gewoon 'Dat ondersteunen we niet' en gaan door.

Alle zes consequent goed doen — dat maakt dat AI-antwoorden klinken alsof ze van jouw team komen. Eén ervan fout doen maakt ze al vreemd, ook als klanten niet kunnen benoemen waarom.

Waarom prompt engineering niet genoeg is

De standaardaanpak voor merkstem in AI-support is prompt engineering. Je schrijft een beschrijving van je merkstem en zet die voor de context van het model: 'Antwoord op een vriendelijke, professionele toon. Vermijd overdreven formaliteit. Houd antwoorden beknopt.'

Dat werkt voor demo's. In productie faalt het, om drie redenen.

Consistentiedrift. LLM's zijn probabilistisch. Dezelfde prompt met net iets andere klantvragen levert antwoorden op met net iets andere tonen. Soms is de AI warmer dan je wilt. Soms kouder. Soms gebruikt hij formuleringen die schuren met je stem. De variatie is onzichtbaar tijdens de evaluatie en constant in productie.

Promptfragiliteit. Kleine verschillen in de formulering van de klant leiden tot andere antwoordpatronen. Een klant die informeel schrijft, krijgt een informeel antwoord. Wie formeel schrijft, krijgt een formeel antwoord. Dat spiegelen voelt voor de AI natuurlijk, maar breekt je merkstem — je merk hoort niet van register te wisselen op basis van hoe de klant schreef.

Dekkingsgaten. Promptinstructies dekken de situaties waar je aan hebt gedacht. Echte klantvragen beslaan een oneindige ruimte. In situaties die je niet had voorzien improviseert de AI een stem, en die improvisatie valt terug op LLM-neutraliteit.

Voor merken met een onderscheidende stem leveren prompt-only-aanpakken antwoorden op die bijna-maar-net-niet kloppen. Klanten merken het, ook als ze niet kunnen benoemen wat er wringt.

Wat wel werkt: fine-tuning op jouw data

De systemen die merkstem echt waarmaken, fine-tunen op je werkelijke supportgeschiedenis. Zo werkt dat proces.

Je bestaande supporttickets bevatten honderden of duizenden voorbeelden van de stem van je team. Elk antwoord dat je agents ooit schreven is een trainingsvoorbeeld — klantvraag erin, antwoord in merkstem eruit.

Fine-tuning past het basismodel aan zodat het deze patronen internaliseert. Het model leert niet alleen woordkeuze, maar de onderliggende beslissingen van je team: wanneer je excuses aanbiedt en wanneer je gewoon oplost, wanneer je context toevoegt en wanneer je kort blijft.

Na fine-tuning produceert het model antwoorden die jouw patronen weerspiegelen, niet de standaardinstellingen van de LLM. De stem is consistent over onderwerpen en vraagtypen heen. Nieuwe vragen krijgen antwoorden die klinken alsof je team ze schreef — omdat het model heeft geleerd van wat je team schreef.

De kosten zijn reëel. Fine-tuning vraagt om schone trainingsdata, evaluatie-infrastructuur en periodieke hertraining naarmate je stem evolueert. De meeste leveranciers investeren hier niet in, omdat het duur is en lastig te laten zien in een demo. Maar het verschil in productie is aanzienlijk.

De blinde test

De eenvoudigste evaluatie is blind lezen.

Haal 20 recente AI-antwoorden uit de tool die je evalueert. Haal 20 recente menselijke antwoorden van je team op. Anonimiseer beide sets — geen handtekeningen, geen metadata. Leg ze voor aan iemand die je merkstem goed kent.

Vraag diegene om elk antwoord te sorteren in een stapel 'AI' of 'mens'.

Lukt dat met hoge nauwkeurigheid — zeg 80% of meer — dan produceert de AI niet jouw merkstem. Dan produceert hij een generieke AI-supportstem met jouw merknaam erin geplakt.

Kan diegene het verschil niet betrouwbaar zien, dan heeft de AI je stem echt geleerd.

De meeste leveranciers zakken voor deze test. Degenen die slagen, zijn de partijen waarmee je serieus in gesprek wilt.

Wat je leveranciers moet vragen

Evalueer je AI-supporttools en doet merkstem ertoe, dan snijden drie vragen door de marketing heen.

'Hoe leert jullie systeem onze specifieke stem, verder dan prompts?' Is het antwoord 'je kunt een stembeschrijving schrijven', dan is het prompt-only. Gaat het antwoord over fine-tuning of trainen op jullie geschiedenis, vraag dan door.

'Kan ik een blinde test draaien op mijn bestaande tickets?' Goede leveranciers hebben hier infrastructuur voor. Ze verwerken een steekproef van je tickets en laten je zelf evalueren. Leveranciers die zeggen 'we kunnen voorbeeldantwoorden van andere klanten delen', ontwijken de vraag.

'Hoe bewaken jullie stemconsistentie over onderwerpen heen?' De faalmodus is dat de AI qua stem goed zit bij simpele vragen, maar drift bij complexe. Leveranciers horen concrete antwoorden te hebben over hoe ze consistentie bewaken over het volledige spectrum aan vragen.

De antwoorden scheiden serieuze leveranciers van marketing.

Wil je de blinde test op je eigen tickets draaien? Start je gratis proefperiode van 14 dagen — alle Business-functies, geen creditcard nodig — of boek een demo van 20 minuten. In beide gevallen weet je binnen een week of het past.

Deel dit artikel

X / TwitterLinkedIn

Veelgestelde vragen

Merkstem is meer dan je bedrijfsnaam invoegen in vriendelijke antwoorden. Zes dimensies bepalen of AI klinkt als jouw team: formaliteitsregister, warmtesignalen, directheid, autoriteitsniveau, humor en speelsheid, en hoe slecht nieuws wordt gebracht. Eén ervan fout doen maakt antwoorden al vreemd — ook als klanten niet kunnen benoemen waarom.

Prompt-only-aanpakken falen in productie om drie redenen: consistentiedrift (dezelfde prompt levert per vraag een andere toon op), promptfragiliteit (de AI spiegelt het register van elke klant in plaats van het jouwe vast te houden) en dekkingsgaten (echte vragen beslaan situaties die de prompt nooit voorzag, waardoor de AI terugvalt op een neutrale LLM-stem).

Fine-tuning traint het model op je werkelijke supportgeschiedenis — elk antwoord van een agent is een trainingsvoorbeeld. Het model internaliseert de beslissingen achter je stem: wanneer excuses aanbieden versus gewoon oplossen, wanneer context toevoegen versus kort blijven. Het resultaat is een consistente stem over alle onderwerpen, omdat het model leerde van wat je team schreef — niet van een beschrijving ervan.

Doe een blinde leestest: haal 20 recente AI-antwoorden en 20 menselijke antwoorden van je team op, anonimiseer beide sets en vraag iemand die je merk kent om ze te sorteren. Sorteert diegene met 80% nauwkeurigheid of meer, dan produceert de AI een generieke supportstem met jouw naam erin. Kan diegene het verschil niet betrouwbaar zien, dan heeft de AI je stem geleerd.

Klaar om AI-support aan het werk te zetten?

14 dagen gratis. Volledig platform. Wij zetten je data voor je over.