Drücke „Enter”, um zum Inhalt zu springen.
Hinweis zu diesem Datenschutz-Blog:
Anscheinend verwenden Sie einen Werbeblocker wie uBlock Origin oder Ghostery, oder einen Browser, der bestimmte Dienste blockiert.
Leider wird dadurch auch der Dienst von VG Wort blockiert. Online-Autoren haben einen gesetzlichen Anspruch auf eine Vergütung, wenn ihre Beiträge oft genug aufgerufen wurden. Um dies zu messen, muss vom Autor ein Dienst der VG Wort eingebunden werden. Ohne diesen Dienst geht der gesetzliche Anspruch für den Autor verloren.

Ich wäre Ihnen sehr verbunden, wenn Sie sich bei der VG Wort darüber beschweren, dass deren Dienst anscheinend so ausgeprägt ist, dass er von manchen als blockierungswürdig eingestuft wird. Dies führt ggf. dazu, dass ich Beiträge kostenpflichtig gestalten muss.

Durch Klick auf folgenden Button wird eine Mailvorlage geladen, die Sie inhaltlich gerne anpassen und an die VG Wort abschicken können.

Nachricht an VG WortMailtext anzeigen

Betreff: Datenschutzprobleme mit dem VG Wort Dienst(METIS)
Guten Tag,

als Besucher des Datenschutz-Blogs Dr. DSGVO ist mir aufgefallen, dass der VG Wort Dienst durch datenschutzfreundliche Browser (Brave, Mullvad...) sowie Werbeblocker (uBlock, Ghostery...) blockiert wird.
Damit gehen dem Autor der Online-Texte Einnahmen verloren, die ihm aber gesetzlich zustehen.

Bitte beheben Sie dieses Problem!

Diese Nachricht wurde von mir persönlich abgeschickt und lediglich aus einer Vorlage generiert.
Wenn der Klick auf den Button keine Mail öffnet, schreiben Sie bitte eine Mail an info@vgwort.de und weisen darauf hin, dass der VG Wort Dienst von datenschutzfreundlichen Browser blockiert wird und dass Online Autoren daher die gesetzlich garantierten Einnahmen verloren gehen.
Vielen Dank,

Ihr Klaus Meffert - Dr. DSGVO Datenschutz-Blog.

PS: Wenn Sie meine Beiträge oder meinen Online Website-Check gut finden, freue ich mich auch über Ihre Spende.
Ausprobieren DSGVO-Check starten sofort das Ergebnis sehen

AI: Welk taalmodel is het beste?

0
Dr. DSGVO Newsletter detected: Extended functionality available
More articles · Website-Checks · Live Offline-AI
📄 Artikel als PDF (alleen voor abonnees van de nieuwsbrief)
🔒 Premium-Funktion
Der aktuelle Beitrag kann in PDF-Form angesehen und heruntergeladen werden

📊 Download freischalten
Der Download ist nur für Abonnenten des Dr. DSGVO-Newsletters möglich

Een nieuw taalmodel (LLM) heeft onlangs voor heel wat opschudding gezorgd. Het behaalde de hoogste score in een populaire benchmark en what zelfs aanzienlijk beter dan ChatGPT-4 Omni, het huidige topmodel van OpenAI. Maar welk taalmodel is nu echt het beste?

Inleiding

Met het Benchmark AlpacaEval worden nieuwe taalsystemen getest. De zogenaamde Win-Rate geeft aan hoe goed een LLM in de test presteert. Hier zijn de eerste plaatsen van de modellen die als bekend kunnen worden beschouwd:

Op de eerste plaats staat GPT-4 Omni van OpenAI met een win rate van 57,5 %. Deze rate wordt lengtecorrect („LC Win Rate“). Dat betekent dat de lengtec Winstpercentages worden verlaagd van GPT-4. Hiermee wordt rekening gehouden met het feit dat GPT-4 als plaatshirsch geldt en een paar eigenaardigheden heeft die andere modellen bij gebrek aan correctie benadelen zouden.

Nu de taalmodellen uit de gemeenschap die minder bekend zijn. De ranglijst voor de communautaire modellen ziet er als volgt uit:

Zoals te zien is, staat het model met de naam NullModel op de eerste plaats. Het heeft een LC Win Rate van 86,5%. ChatGPT-4 Omni had daarentegen slechts 57,5% (16e plaats in de ranglijst, waarin ook de community-modellen zijn opgenomen).

De benchmark is op zichzelf geen goede vertegenwoordiger voor AI-taken die in uw bedrijf of organisatie aan de orde zijn. Want komt het er namelijk heel veel op aan. Sommige modellen kunnen beter vragen begrijpen, andere beter concluderen of weer anderen kunnen tekst beter samenstellen of vertalen.

Voor Duitse bedrijven is het vooral relevant dat Duits doorgaans de hoofdtaal in het bedrijf en in tekstdocumenten is. De benchmarks zijn echter doorgaans voor Engels of andere talen, zoals Chinees of Hindi, geoptimaliseerd.

Het speciale kenmerk van de testwinnaar

Op zichzelf is een benchmark daarom meer een indicator dan een betrouwbare verklaring.

Er is een bijzonderheid met de winnaar, het NullModel: Het heeft gefraudeerd. Maar dat is nog niet alles: Het taalmodel NullModel geeft altijd dezelfde antwoord op alle vragen die in het benchmark gesteld worden. De code daarvoor is zelfs openbaar beschikbaar.

Het NullModel komt dus op de eerste plaats in het testresultaat, hoewel het altijd dezelfde antwoord geeft op alle gestelde vragen. De vragen hebben echter elk een volledig verschillende juiste antwoord. Waren de juiste antwoorden steeds "Ja" dan zou men zich hier niet meteen zorgen moeten maken.

In werkelijkheid zijn dus heel veel verschillende antwoorden voor de vele vragen in het Benchmark correct. Toch levert het Benchmark de Bestnoten voor het LLM, dat altijd hetzelfde antwoord geeft.

De benchmark is dus voor de gek gehouden.

Wat is het beste taalmodel?

Een advocaat zou zeggen: Dat hangt ervan af. Het hangt af van de aanvraag.

Als je niet weet waarvoor een AI-systeem gebruikt moet worden, heb je heel andere problemen dan het vinden van het beste taalmodel. De bekende modellen in de eerste afbeelding zijn zeer geschikt voor een algemene chatbot.

Als men weet uit het internet moet opzoeken, faalt ChatGPT regelmatig. De reden is dat een laag-budget systeem (vanuit de oogpunt van de gebruiker die vaak ook zijn gegevens betaald) per prompt niet oneindig veel zoekacties in het internet kan uitvoeren. Dat zou gewoonweg onrendabel zijn voor OpenAI. Zoals men bij Anthropic en hun Computer Use-benadering kan lezen, wordt het snel heel duur. Er komen doorlopend 20 dollar per uur samen voor een taak die onderzoekswerk vereist. Helaas is bij indienen van de opdracht aan de AI niet bekend hoe moeilijk het is om het resultaat te bepalen.

Het beste taalmodel voor een use case in uw bedrijf is een goed getrainde LLM.

Enkele aanbevelingen voor taalmodellen helpen bij de juiste opstelling en de start van een AI-strategie.

Omvang van het taalmodel

Als Rule of thumb geldt: Hoe onspecifieker de opdracht, hoe groter het LLM moet zijn. Het maximale voorbeeld is ChatGPT. Dit model is zo enorm dat de hardware om het te bedienen miljoenen euro's kost (en nog veel meer voor OpenAI, omdat er meer dan 10 gebruikers van het systeem gebruik maken).

ChatGPT kan vragen van alle soort beantwoorden en levert vaak zeer goede resultaten. Maar zelfs eenvoudige vragen kunnen soms niet goed worden beantwoord. Zo kan ChatGPT bijvoorbeeld de hoeveelheid "r" in het woord Strawberry niet correct tellen. Bovendien maakt ChatGPT ook gebruik van vals kennis dat is ingespeeld in het LLM. Niet alleen daardoor ontstaan Hallucinaties.

De grootte van een taalmodel wordt gespecificeerd in miljarden parameters. Eén miljard is 1 B (B = miljard). Een parameter is een verbinding tussen twee neuronen in het neurale netwerk.

Sehr kleine taalmodellen hingegen, zoals bijvoorbeeld Llama3.2-1B, zijn goed geschikt voor mobiele apparaten of in het algemeen voor hoge antwoord snelheden. Daaronder lijdt echter de antwoordkwaliteit. Algemene vragen kunnen vaak heel goed beantwoord worden. Wordt de vraag in het Duits gesteld, ziet het er weer anders uit, namelijk slechter. De Duitse grammatica wordt hier niet voldoende gewaardeerd.

Kleinere taalsystemen zoals 7B- of 8B-modellen beheersen de Duitse taal vaak zeer goed. Ze kunnen teksten samenvatten, ideeën genereren of teksten vertalen. Op een standaard-AI-server is de uitvoeringsnelheid matig.

Met behulp van gehercalculateerde modellen kan de snelheid van inferentie verhoogd worden. De kwaliteit lijdt er slechts marginaal onder.

De beste AI-modellen zijn die die in een AI-systeem zijn geïntegreerd en concrete taakopdrachten willen uitvoeren. Een AI-systeem is soort van een kaderprogramma, dat naast het AI-deel ook conventionele logica bevat. Waarom zou een taalmodel de hoeveelheid letters in een woord moeten tellen als klassieke programmeertaal dit veel sneller en beter kan, namelijk met 100% nauwkeurigheid?

Een voorbeeld van een concrete opgave is een AI-assistent voor de personeelsafdeling. Een sollicitant stuurt zijn curriculum vitae naar de HR-afdeling na het zien van een vacature. De HR-afdeling wil nu weten hoe goed het curriculum vitae van de sollicitant past bij de eisen die in de vacature (hopelijk) worden genoemd. De AI-assistent vergelijkt nu het curriculum vitae met de vacature. Het AI-systeem omheen zorgt ervoor dat het curriculum vitae en de daarbij genoemde vaardigheden vanuit meerdere perspectieven worden bekeken: Welke vereiste kennis is goed ingevuld en welke niet? Welke opvallende eigenschappen heeft de sollicitant in het algemeen, die voor elk bedrijf waardevol kunnen zijn?

Feinheiten worden ook in aanmerking genomen: een informaticus hoeft zijn CV niet te vermelden dat hij JSON beheerst. Hij kan het al doen of hij leert het binnen 5 tot 45 minuten. Dergelijke dingen kunnen ChatGPT gewoon niet weten. Maar de vakafdeling weet het wel en kan het AI-systeem programmeren.

Een AI-assistent voor de personeelsafdeling kan ook online-recherche uitvoeren naar een kandidaat en de resultaten presenteren aan de recruiter. Dit kan eveneens niet door een AI-model worden gedaan. Een AI-systeem, zoals ChatGPT, doet dat evenmin voor u. In ieder geval niet voor ongeveer 22 euro per maand of voor een fractie van een cent per aanvraag. OpenAI wil het internet niet uitvoerig doorzoeken omdat u bij OpenAI geen geld wilt geven of al bij 50 euro over uw kosten begint na te denken.

Met behulp van Fijnafstemming kunnen taalmodellen worden aangepast aan concrete taken. De resultaten zijn meestal duidelijk beter dan u zou bereiken met ChatGPT of enige andere universele intelligentie. Zulke geïntraneerde modellen kunnen bovendien zeer klein zijn. Zo is de inferentiesnelheid potentieel zeer hoog.

Andere modellen naast LLM's

Klassieke taalmodellen zijn waarschijnlijk de meest gebruikte AI-modellen. Maar er zijn er nog veel meer.

Beispielswijze zijn er zogenoemde Beschermingsmodel. Deze LLMs zijn alleen bedoeld om inmenging van een gebruiker of uitvoer van een ander taalmodel te controleren. Bevat de ingave een oproep tot een illegale handeling? Bevat de uitvoer instructies voor het maken van bommen?

Klassifikatietaken zijn beter geschikt voor andere modeltypen dan LLMs. Je wilt bijvoorbeeld weten wel soort email iemand naar jouw bedrijf heeft gestuurd. What het een aanvraag? What het een klacht? What het een opzegging? Of wilde de afzender alleen maar dat er een contactpersoon genoemd werd? Hiervoor train je een classificator. Dat is weinig moeite, maar brengt enorm veel.

Om minder ervaren medewerkers te ondersteunen zijn Vector zoekmachines heel geschikt. Een klant van een autoverhuurbedrijf meldt een schade per e-mail of app. De medewerker bij het autoverhuurbedrijf moet nu beslissen hoe de schade wordt geregeld. De AI-assistent zoekt naar vergelijkbare gevallen uit het verleden en presenteert aan de medewerker aanbevelingen voor het waarschijnlijk beste verloop. Zulke historische gegevens zijn vooral bij verzekeraars in overvloed beschikbaar.

Bildmodellen zijn algemeen bekend. Ze leveren goede tot zeer goede diensten. Maar nog beter gaat het met fijngetrainde beeldmodellen of Adaptertern. Hiermee kunnen beelden naar uw wens (stijl, aanblik, kleurgeving, onderwerp) geproduceerd worden. Hier een voorbeeld:

Je zult zeker kunnen achterhalen wat het sjabloon voor dit type afbeelding what. Het aantal voorbeelden voor het aanleren van een beeldbewerker kan erg klein zijn. Vaak zijn 8 of 15 voorbeelden voldoende, afhankelijk van de spreiding van het beeldmateriaal. Het aantal voorbeelden kan worden vergroot door synthetische toevoeging.

Audio transcription: er zijn nu uitstekende Whisper-modellen beschikbaar die betere resultaten opleveren dan de standaard van Microsoft in Teams. Dat bleek uit een test met een privacyuitgever. De transkriptie werd vergeleken met Microsoft Teams en die van Dr. GDPR met behulp van een eigen AI-systeem. Het eigen AI-systeem houdt rekening met bedrijfs-specifieke vocabulair, dat ook achternamen bevat. Niemand weet of Schmitt geschreven wordt met één of twee "t" of met "dt", laat staan een AI.

Voorbeelden van AI-modellen en hun mogelijkheden

Aan de hand van enkele voorbeelden zal worden aangetoond hoe de grootte van het model, de actualiteit van het model en het type gegevensinvoer (tekst, afbeelding, …) de responskwaliteit beïnvloeden:

  • Llama3-7b: Slecht naar huidige maatstaven, geweldig toen het werd uitgebracht; kan goed draaien op zijn eigen hardware
  • Llama3-1:8b: Zeer goed voor veel taken; kan goed draaien op eigen hardware
  • Llama3-70b: Goed tot zeer goed voor veel taken, maar deels slechter dan de nieuwere Llama3.1:8b; kan alleen redelijk werken op dure hardware
  • Llama3.1-70b: Zeer goed voor veel taken; een paar zwakke punten voor Duits; kan alleen goed draaien op dure hardware
  • Llama3.1-405b: Nog beter dan Llama3.1:70b, maar niet noodzakelijkerwijs voor Duits; kan alleen redelijk draaien op zeer dure hardware
  • Llama3.2-3b: Goed, maar slechter dan Llama3.1:8b, maar snellere antwoorden

Naast deze LLM's zijn er nog andere modeltypen. Hier volgen enkele voorbeelden:

  • Pixtral-12B: Zeer goed voor het ondervragen van beelden. Aanvaardbare hardwarevereisten
  • Qwen2.5-72B: zeer goed voor het genereren van programmacode; kan alleen redelijk werken op dure hardware
  • FLUX.1-snel: soms zeer goede resultaten bij het genereren van afbeeldingen, maar vaak ontoereikend bij het genereren van Duitse teksten in de afbeelding; kan met trucjes ook redelijk werken op goedkopere hardware

De kwaliteit van de resultaten varieert daarom afhankelijk van de actualiteit en de grootte van het model. Tekst vereist meestal exacte uitvoer, behalve voor creatieve taken. Voor afbeeldingen is de situatie vaak anders.

Conclusie

Bepaal je use case. Als je geen idee hebt waar AI je bij kan helpen, dan heb je geen AI nodig. Gebruik in plaats daarvan een zoekmachine, zoals altijd.

Begin met een eenvoudige use case. Als je niet zeker weet wat eenvoudig zou kunnen zijn, vraag dan om advies.

Hoe kleiner het AI-model, hoe specifieker de use case moet zijn. Zeer grote modellen, zoals die met 405B parameters, moeten meestal niet door uw bedrijf zelf worden bediend. Zelfs als de middelen beschikbaar zouden zijn, zijn er meestal betere opties.

Een 70B model zoals Llama3.1-70B is al behoorlijk groot voor zelfbediening. Dit is slechts om je een algemeen idee te geven. Modellen niet groter dan de helft van deze grootte zijn beter.

Voor taken die geen generatieve antwoorden vereisen, zijn er betere opties dan de AI-modellen die "iedereen" kent. Deze modellen zijn ideaal voor het vinden van kennis in uw bedrijfsdocumenten. De hardwarevereisten zijn ook zo laag dat niemand hoeft na te denken over de aankoop- of huurprijzen. Semantisch zoeken, d.w.z. het vergelijken van teksten of afbeeldingen (of audio of …), is een ander voorbeeld van een verstandige start van het AI-tijdperk.

Wie je eigen AI bedreven wordt, hoeft men zich om Datensicherheid weinig tot geen zorgen te maken. Weinig zorgen dan als een GPU-server in Duitsland van een Duitse provider met DPA gehuurd wordt en helemaal geen zorgen als een eigen server in uw datacentraal staat of per colocatie gehuurd wordt.

Eigen AI betekent: Volledige controle over de gegevens. Gegevens gaan nergens heen, behalve als je dat wilt. Gegevens worden nergens van opgeroepen, behalve als je dat wilt. Alleen gebruikers mogen via AI toegang krijgen tot documenten waar ze recht op hebben. Dat wordt Offline-AI genoemd.

Concluderend: Welk taalmodel of ander AI-model het meest geschikt is voor jouw use case moet worden beoordeeld op basis van de specifieke use case. Er zijn elke week nieuwe AI-innovaties en -modellen. Het is dus de moeite waard om er eens goed naar te kijken.

Belangrijkste boodschappen van dit artikel

Het NullModel is het "beste" model in de benchmark, maar het geeft altijd hetzelfde antwoord op alle vragen – wat niet echt nuttig is. Het beste taalmodel hangt af van de toepassing.

Voor eenvoudige vragen zijn kleinere taalmodellen zoals 7B of 8B modellen beter geschikt, omdat ze de Duitse grammatica vaak beter beheersen dan grotere modellen.

AI-assistenten kunnen historische gevallen doorzoeken om de beste handelwijze aan te bevelen.

Begin met een eenvoudige toepassing zoals semantisch zoeken in bedrijfsdocumenten.

Over deze kernuitspraken
About the author on dr-dsgvo.de
My name is Klaus Meffert. I have a doctorate in computer science and have been working professionally and practically with information technology for over 30 years. I also work as an expert in IT & data protection. I achieve my results by looking at technology and law. This seems absolutely essential to me when it comes to digital data protection. My company, IT Logic GmbH, also offers consulting and development of optimized and secure AI solutions.

AI voor fotoagentschappen en creatieven