Thomson Reuters bouwt eigen frontier AI-model

Thomson Reuters bouwt eigen frontier AI-model

Thomson Reuters heeft een eigen large language model ontwik­keld dat volgens het bedrijf op speci­fieke profes­si­o­nele taken kan concur­reren met de nieuwste fron­tier­mo­dellen van de bekende Big Tech-firma’s. Het model, simpelweg “Thomson” genoemd, wordt als eerste ingezet binnen de juri­di­sche AI-omge­ving CoCounsel Legal. Opval­lend is vooral de manier waarop het bedrijf het model heeft gebouwd. Thomson Reuters inves­teerde onge­veer 40 miljoen dollar en begon niet vanaf nul, maar gebruikte een bestaand open model als funda­ment. Daarmee laat de onder­ne­ming tege­lij­ker­tijd zien hoe aantrek­ke­lijk én hoe lastig het voor grote bedrijven is om zelf een fron­tier­model te ontwik­kelen.

De stap is inte­res­sant omdat Thomson Reuters over iets beschikt waar vrijwel iedere AI-ontwik­ke­laar naar op zoek is: enorme hoeveel­heden hoog­waar­dige, gespe­ci­a­li­seerde data. Het concern beheert onder andere juri­di­sche, fiscale en finan­ciële infor­matie en heeft tien­tallen jaren erva­ring met het struc­tu­reren, contro­leren en actu­a­li­seren van profes­si­o­nele content. Juist met die combi­natie van data en domein­kennis wil Thomson zich onder­scheiden van alge­mene modellen zoals GPT, Claude en Gemini.

Niet vanaf nul beginnen

Wie bij een eigen fron­tier­model denkt aan een compleet nieuw AI-systeem dat van de eerste para­meter tot de laatste token zelf­standig is ontwik­keld, krijgt bij Thomson echter een ander beeld. Het bedrijf zegt expli­ciet dat het is begonnen met een sterke open source-basis. Naar verluidt bouwt Thomson voort op Snowdon, dat op zijn beurt is geba­seerd op Alibaba’s Qwen-tech­no­logie. Thomson Reuters heeft die basis vervol­gens verder getraind en gespe­ci­a­li­seerd met eigen kennis en data.

Dat onder­scheid is belang­rijk. De grote AI-labs inves­teren miljarden dollars in het trainen van modellen vanaf de basis, inclu­sief de beno­digde GPU-clus­ters, data­cen­ter­ca­pa­ci­teit, trai­nings­soft­ware en onder­zoeks­teams. Thomson Reuters koos voor een veel gerich­tere route. Het bedrijf zegt onge­veer 40 miljoen dollar te hebben geïn­ves­teerd in talent en compute om Thomson te trainen en te opti­ma­li­seren.

Dat blijft een aanzien­lijk bedrag, maar ligt ver onder de bedragen die inmid­dels worden geas­so­ci­eerd met de ontwik­ke­ling van de grootste alge­mene AI-modellen.

Frontiermodel voor een specifiek domein

Thomson Reuters noemt Thomson zelf een fron­tier­model en zegt dat vroege evalu­a­ties laten zien dat het model voor verschil­lende taken op het niveau van recente fron­tier­mo­dellen pres­teert. Eerder meldde het bedrijf al dat Thomson voor speci­fieke juri­di­sche taken modellen van onder andere OpenAI, Anthropic en Google kon over­treffen.

Daarbij is wel een belang­rijke nuance nodig. Thomson hoeft niet nood­za­ke­lij­ker­wijs over de volle­dige breedte dezelfde capa­ci­teiten te hebben als bijvoor­beeld de grootste modellen van OpenAI, Google of Anthropic. Thomson Reuters richt zich vooral op taken binnen domeinen waarin het zelf over veel hoog­waar­dige infor­matie beschikt.

Dat is misschien wel het inte­res­santste aspect van deze ontwik­ke­ling. De AI-markt zou zich daarmee kunnen bewegen van één soort fron­tier naar meer­dere gespe­ci­a­li­seerde fron­tiers. Een juri­disch model hoeft bijvoor­beeld niet de beste soft­wa­re­code te schrijven, natuur­kun­dige problemen op te lossen of foto’s te inter­pre­teren. Het moet vooral uitzon­der­lijk goed zijn in juri­di­sche analyse, instruc­ties nauw­keurig volgen en contro­leer­bare resul­taten produ­ceren. Voor bedrijven kan zo’n gespe­ci­a­li­seerd model veel waar­de­voller zijn dan een veel groter alge­meen model.

Eigen data wordt strategisch bezit

Thomson Reuters heeft naar eigen zeggen tot nu toe minder dan 10 procent van zijn eigen content gebruikt voor de trai­ning van Thomson. Meer data toevoegen is volgens het bedrijf boven­dien niet auto­ma­tisch de volgende stap. Het wil vooral onder­zoeken hoe verdere speci­a­li­satie de pres­ta­ties kan verbe­teren.

Daarmee verschuift ook de discussie over de waarde van bedrijfs­data. De afge­lopen jaren draaide AI vooral om de vraag wie over de grootste modellen en meeste reken­kracht beschikt. Voor gespe­ci­a­li­seerde bedrijfs-AI kan een andere factor minstens zo belang­rijk worden: wie beschikt over unieke, goed gestruc­tu­reerde en betrouw­bare gege­vens waarmee een bestaand sterk model verder kan worden ontwik­keld?

Thomson Reuters bevindt zich wat dat betreft in een bijzon­dere positie. Juri­di­sche data­banken zoals Westlaw en Prac­tical Law bevatten enorme hoeveel­heden gecu­reerde profes­si­o­nele kennis. Die data is niet zomaar via het open­bare internet beschik­baar en is boven­dien jaren­lang door speci­a­listen onder­houden en gestruc­tu­reerd.

Waarom bouwt dan niet ieder groot bedrijf een eigen frontiermodel?

Daarmee ontstaat tege­lij­ker­tijd een inte­res­sante vraag. Als Thomson Reuters voor circa 40 miljoen dollar een gespe­ci­a­li­seerd model kan ontwik­kelen dat op rele­vante taken met fron­tier­mo­dellen kan concur­reren, waarom zouden bijvoor­beeld banken, verze­ke­raars, tech­no­lo­gie­be­drijven of grote indu­striële concerns dan niet hetzelfde doen?

Het antwoord is waar­schijn­lijk dat een eigen AI-model veel meer vereist dan alleen veel data. Aller­eerst moet die data bruik­baar zijn. Veel onder­ne­mingen beschikken welis­waar over enorme hoeveel­heden docu­menten, data­bases, e‑mails, rappor­tages en tech­ni­sche gege­vens, maar die infor­matie is versnip­perd over verschil­lende systemen en vaak onvol­doende gestruc­tu­reerd of gela­beld. Thomson Reuters heeft juist als kern­ac­ti­vi­teit het verza­melen, contro­leren en struc­tu­reren van infor­matie.

Daar­naast is speci­a­lis­ti­sche AI-kennis schaars. Het aanpassen van een bestaand open model vraagt niet alleen om data scien­tists, maar ook om experts op het gebied van mode­l­ar­chi­tec­turen, distri­buted trai­ning, evalu­atie, align­ment, secu­rity en infe­rence-opti­ma­li­satie. Daar komen domein­ex­perts bovenop die kunnen bepalen of de antwoorden van het model daad­wer­ke­lijk goed zijn.

En zelfs wanneer een model eenmaal is getraind, begint het werk pas. Modellen moeten continu worden geëva­lu­eerd, bijge­werkt, bevei­ligd en opera­ti­o­neel beheerd. Ook moet infra­struc­tuur beschik­baar zijn om miljoenen infe­rence-verzoeken betrouw­baar en tegen accep­ta­bele kosten te verwerken.

Het verschil tussen data hebben en data kunnen gebruiken

Daarmee wordt duide­lijk waarom zelfs zeer grote onder­ne­mingen niet auto­ma­tisch in staat zijn om een eigen fron­tier­model te bouwen. Een auto­fa­bri­kant kan peta­bytes aan produc­tie­data hebben en een bank kan beschikken over miljarden trans­ac­ties, maar dat bete­kent nog niet dat die infor­matie recht­streeks als kwali­ta­tieve trai­nings­data kan worden ingezet.

Daar­naast spelen juri­di­sche vragen een rol. Mag bedrijfs­in­for­matie worden gebruikt voor het trainen van een model? Welke persoons­ge­ge­vens zitten erin? Wie bezit het intel­lec­tuele eigendom? Kunnen klanten bezwaar maken tegen het gebruik van hun gege­vens? En kan achteraf worden vast­ge­steld welke infor­matie invloed heeft gehad op een antwoord?

Voor Thomson Reuters zijn derge­lijke vragen extra rele­vant omdat het model wordt ingezet voor juri­disch en fiscaal werk, waar fouten grote gevolgen kunnen hebben. Het bedrijf legt daarom veel nadruk op veri­fi­catie. Waar de AI-sector volgens Thomson Reuters jaren­lang vooral heeft gecon­cur­reerd op pure model­ca­pa­ci­teit, verwacht het bedrijf dat de volgende concur­ren­tie­slag rond de veri­fi­ca­tion layer wordt uitge­vochten: niet alleen een over­tui­gend antwoord gene­reren, maar ook kunnen contro­leren of dat antwoord correct en verant­woord is.

Minder afhankelijk van externe AI-leveranciers

Er speelt boven­dien een tweede stra­te­gisch argu­ment. Met een eigen model wordt Thomson Reuters minder afhan­ke­lijk van externe aanbie­ders zoals OpenAI, Anthropic en Google. Het bedrijf houdt overi­gens vast aan een multi-model­stra­tegie. Binnen CoCounsel worden verschil­lende modellen gebruikt afhan­ke­lijk van de taak. Thomson wordt ingezet waar het volgens Thomson Reuters een duide­lijk voor­deel biedt.

Dat maakt de stra­tegie wellicht inte­res­santer dan simpelweg proberen alle externe modellen te vervangen. Een onder­ne­ming kan alge­mene fron­tier­mo­dellen blijven gebruiken voor taken waarin die modellen uitblinken, terwijl bedrijfs­spe­ci­fieke workloads worden uitge­voerd door een eigen gespe­ci­a­li­seerd model. Daarmee ontstaan hybride AI-archi­tec­turen waarin orga­ni­sa­ties modellen selec­teren op basis van kosten, pres­ta­ties, privacy, locatie van verwer­king en beno­digde exper­tise.

Ook AI-soeve­rei­ni­teit speelt daarbij natuur­lijk een rol. Met een eigen model krijgt Thomson Reuters meer controle over hoe het model wordt getraind, waar het draait, welke bevei­li­gings­maat­re­gelen worden toege­past en welke gege­vens worden gebruikt. Volgens het bedrijf worden klant­ge­ge­vens boven­dien niet zonder expli­ciete toestem­ming gebruikt om Thomson verder te trainen.

Duizenden documenten tegelijk analyseren

De eerste concrete toepas­sing van Thomson bevindt zich in wat genoemd wordt “Tabular Analysis” binnen CoCounsel Legal. Daarmee kunnen juri­di­sche profes­si­o­nals grote hoeveel­heden docu­menten analy­seren en infor­matie gestruc­tu­reerd in tabellen laten verwerken. De nieuwste versie zou tot 10.000 docu­menten per tabel kunnen analy­seren.

Dat is precies het soort toepas­sing waarbij een gespe­ci­a­li­seerd model inte­res­sant kan zijn. Het gaat niet om een chatbot die iedere moge­lijke vraag moet kunnen beant­woorden, maar om een duide­lijk afge­ba­kende profes­si­o­nele work­flow met grote hoeveel­heden domein­spe­ci­fieke infor­matie.

Thomson Reuters wil het model later ook inzetten binnen zijn juri­di­sche en fiscale product­port­folio en spreekt daar­naast over toekom­stige moge­lijk­heden voor sove­reign AI.

Misschien verandert vooral de definitie van een frontiermodel

De intro­ductie van Thomson laat daarmee een inte­res­sante ontwik­ke­ling zien. De vraag voor grote orga­ni­sa­ties wordt moge­lijk steeds minder of zij een compleet nieuw foun­da­tion model kunnen of willen bouwen. Veel rele­vanter is of zij een bestaand krachtig open model zo ver kunnen speci­a­li­seren dat het binnen hun eigen domein beter pres­teert dan veel grotere alge­mene modellen. Dat is een wezen­lijk andere AI-stra­tegie.

Voor een beperkt aantal orga­ni­sa­ties met zeer waar­de­volle eigen data­sets, voldoende kapi­taal en uitge­breide domein­kennis kan het aantrek­ke­lijk worden om die route te volgen. Thomson Reuters laat tege­lij­ker­tijd zien dat de drempel nog altijd hoog is. Een inves­te­ring van 40 miljoen dollar, gespe­ci­a­li­seerde AI-teams, hoog­waar­dige prop­rietary data en jaren­lange domein­kennis maken dit niet tot een project dat iedere onder­ne­ming eenvoudig kan kopi­ëren.

Misschien is daarom de conclusie niet zozeer dat grote bedrijven voortaan alle­maal hun eigen fron­tier­model gaan bouwen. Inte­res­santer is dat de defi­nitie van fron­tier AI aan het veran­deren is. De volgende gene­ratie zeer krach­tige bedrijfs­mo­dellen hoeft niet nood­za­ke­lij­ker­wijs groter te zijn dan GPT, Claude of Gemini. Ze moeten vooral aantoon­baar beter zijn in precies dat kleine deel van de wereld waarin een orga­ni­satie zelf de meeste kennis bezit.

Robbert Hoeffnagel

25 augustus 2026 - 09:08

WEERGAVEN

0 Reacties

Gerelateerde berichten

Cloudera gaat met NVIDIA cloudkosten verlagen en Apache Spark-pipelines versnellen

Cloudera gaat met NVIDIA cloudkosten verlagen en Apache Spark-pipelines versnellen

Met Donna Voice-AI brengt Biobest klantinformatie sneller samen in SAP Sales Cloud

Met Donna Voice-AI brengt Biobest klantinformatie sneller samen in SAP Sales Cloud

AI-bedrijven vaag over gebruik van klantdata: 63 procent zegt niet duidelijk of data wordt gebruikt voor training

AI-bedrijven vaag over gebruik van klantdata: 63 procent zegt niet duidelijk of data wordt gebruikt voor training

Nog geen gerelateerde berichten...

0 Reactie(s)

0 Reacties

Plaats Een Reactie

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *

Share This