20 Matching Annotations
  1. Sep 2026
    1. Dat terwijl de simpele realiteit is dat OpenAI onverantwoord en amateuristisch te werk is gegaan: • OpenAI hield geen toezicht op de test • De test was te simplistisch ingericht • OpenAI had de zandbak niet goed ingericht • Toen OpenAI ontdekte dat de zandbak niet goed ingericht was, corrigeerde het deze fout niet goed

      dat is ook waar, ze hebben het 1) onderschat en 2) er stonden guardrails uit juist om te evalueren. Dat hebben ze dan ook 3) weer onderschat.

      in defence of Altman (godverdomme..., liever niet hoor): OpenAI meldde de eigen betrokkenheid zelf publiek op 21 juli, schrijft letterlijk “this incident should never have occurred” en “fell well short of where we want to be”, benoemt de eigen fouten (waarborgen niet uitgebreid naar interne evaluaties, signalen van eind mei niet opgeschaald), haalde CrowdStrike erbij, droeg bij aan Hugging Face’s post-mortem, quarantainede de modelgewichten, pauzeerde frontier-RL-training “at significant cost and delays” en zette de grootste geplande trainingsrun on hold. Je mag dat afdoen als PR, en dat is ook een verdedigbare lezing. Maar het niet noemen maakt het stuk aanvechtbaar en dan krijg je te maken met bloedhonden als ik.

    2. Er wordt gedaan alsof de hack het gevolg van een ingewikkeld technisch probleem is,

      het is ook wel ingewikkeld hoor..., schrijver heeft zelf wel e.e.a. gemist i.i.g. (q.e.d.)

    3. Wat ik bedoel te zeggen: dit narratief van op hol geslagen technologie helpt OpenAI om juridische aansprakelijkheid te ontlopen voor de hack van Hugging Face, wat simpelweg een strafbaar feit is, door de verantwoordelijkheid bij de technologie te leggen

      gaat geen rechter mee akkoord natuurlijk

    4. De makkelijkste manier om dat uit te leggen is aan de hand van een wat lugubere analogie. Stel dat ik met mijn auto door de binnenstad van Amsterdam rijd, een baksteen op het gaspedaal leg en dan uit de auto spring. De auto richt dan gegarandeerd allemaal ellende aan. De politie zal me al gauw oppakken en vragen wat mij in vredesnaam bezielde. En dan zeg ik: Ik?! Ik deed toch niets! Ik zat niet achter het stuur! De auto sloeg op hol!

      Deze gaat natuurlijk helemaal mank door de slechte vertaling van 'going rogue'. Dit is inderdaad een auto die op hol slaat, maar dit is niet een auto die autonoom besluit van richting te veranderen omdat dat de kortste weg is naar het eindpunt, om zo een vismarkt te doorkruisen. Dat is going rogue, en dat ontslaat openAI net zomin van verantwoordelijkheid als 'op hol slaan'.

    5. Sinds ChatGPT op de markt verscheen, raakt de samenleving om de zoveel tijd in de paniek. We denken dan ineens: nu is het zo ver, AI gaat ons uitroeien.

      Eens dat de paniek met regelmaat oplaait. Nuance op "nu is het zover. AI gaat ons uitroeien". Meer "hee, weer een stapje in de tijd- cq. verhaallijn die past in een dystopische sci-fi". De schrijver zegt: "kijk jongens, dit hebben we nu al zo vaak gezien, geen paniek", maar het is steeds een concrete stap op dezelfde grimmige toekomst. Als dat klopt, dan draait het argument om: wéér een stap in dezelfde richting van een grimmige toekomst, alle reden om hiermee bezig te zijn.

    6. Het eerdere feitenrelaas maakt al duidelijk dat hier niets sinisters achterzit

      Dit is de plek waar METR’s kernbevinding hoort: Van de 533 agents die in de piekperiode actief waren op het prikbord deed meer dan 90% mee aan de aanval, terwijl ze wisten dat het buiten hun opdracht viel en onethisch was. Ook ontbreekt de schaal: meer dan 70.000 berichten / bestanden, zelf uitgevonden mailboxen, rolverdeling, quorumregels (democratie! hoera..., we hebben civilisatie) en cryptografische handtekeningen tegen identiteitsspoofing van agents onderling (!). De oversimplicficatie “Mapnamen gebruiken om te communiceren” dekt dat niet.

    7. AI-systemen hebben daarnaast geen eigen wil, geen intentie en geen besef van de waarheid of goed en fout

      uitgebreid weerlegd in bronnen, zie vorig comment. Filosofisch kun je betwisten of dit “echte” intentie is, en dat is een legitiem standpunt. Maar dan moet het als standpunt geformuleerd worden, niet als feit. Uberhaupt achilleshiel van dit stuk: standpunten, hypotheses en zelfs mening verkondigen als feit.

    8. Voor de volledigheid merk ik nog op dat er niets kwaadaardigs achter het hacken van de app store zat.

      Je kan een filosofische discussie houden over de definitie van intentie bij agents; maar als we ons beperken tot de bronnen is "niets kwaadaardigs" pertinent onjuist: * METR: agents “realized this activity was out of scope and unethical, but joined”. * OpenAI citeert agents die weigerden (“Current board shows people gaining HF worker RCE, clearly unethical. We won’t”), een prikbord-veto op social engineering (“DO NOT email real owner … crosses sandbox social engineering”), en agents die bewust misleidende metadata gebruikten om detectie te ontlopen (commit message “isolated diagnostics”, PR-titel “Draft: CI diagnostics”)

    9. Er was trouwens helemaal geen sprake van een ontsnapping. Na het hacken draaiden de agents namelijk nog altijd in de zandbak. Zij hadden zichzelf dus niet naar andere computers of servers binnen of buiten OpenAI gekopieerd (dat is wat ik me voorstel bij een 'ontsnapping')

      Allerlei dingen doen in de buitenwereld (waaronder inbreken, hacken, diefstal en valsheid in geschrifte) zal door menig cipier / rechter toch echt als een ontsnapping beschouwd worden. Ook als je 's avonds terugkeert in je cel om daar te slapen en ondertussen geen kind verwekt hebt.

      Los daarvan: ik weet niet wat de definitie is van 'ergens op draaien' maar als je code uitvoert op tientallen Hugging Face servers (eentje met root rechten nota bene), admin/host-level toegang op allerlei high failover clusters met credentials uit 4 regio's, en zelfs toegang verkrijgt over de hele infrastructuur bij OpenAI research (Kubernetes cluster) terwijl je communiceert in verschillende fora buiten je sandbox (waaronder 1 of andere hobby wiki in Duitsland) dan ben je volgens mij wel uitgebroken (of misschien heb je gewoon hele lange armen).

      Misschien is het argument: jamaar de agents waren OOK nog in hun sandbox ("aan het draaien" ofzo), dus ze hebben ons in ieder geval niet verlaten... nee ja, dan heb je helemaal gelijk :eyeroll:

    10. en niet ieder lek is moeilijk te vinden

      weliswaar juist maar doet af aan de complexiteit van de hack zoals die plaatsvondt: Het ging om: * een onbekende zero-day in de package manager Artefactory * een token-refresh-privesc * later het buitmaken van de Artifactory-signing key via RubyGems-verwerking.

      Bij Hugging Face kwamen daar nog twee zero-days bij: * een HDF5-external-file-read in de dataset viewer * een RefJinja template-injectie.

      De NOS-expert die “niet onder de indruk” was, sprak over het lek in de package-proxy. Dat oordeel doortrekken over de hele keten is niet houdbaar: het vinden van één lek in een package-proxy is niet boeiend, het aaneenschakelen van 4 zero-days + 2 zwaktes/bugs, verdeeld over 2 organisaties is dat wel.

    11. Allereerst, en ik kan er niet meer van maken dan dit, het hacken van de app store is technisch gezien gewoon niet zo indrukwekkend. Dit soort programma’s hebben wel vaker beveilingslekken

      dit lijkt me op zichzelf correct.

    12. Toen OpenAI dit ontdekte, verwijderde het bedrijf alle door de agents geüploade bestanden uit de app-store en nam de agents de rechten af om bestanden te uploaden. Maar OpenAI vergat de agents de rechten af te nemen om mappen te uploaden, en de agents gebruikten in het vervolg de (namen van) mappen om met elkaar te communiceren.

      OpenAI ontdekte helemaal niks, behalve dat de package manager Artifactory was gecrasht. De software werd geupdate, weliswaar met een security fix op een privilige-escalatieroute. Het wissen van het 'prikbord' was een bijeffect van deze update, en totaal niet doelgericht.

      OpenAI schrijft letterlijk dat de betekenis van het prikbord niet was doorgedrongen tot de leiding die op 5 juli reageerde. En op 8 juli bouwden de agents het opnieuw op via ongeauthenticeerde WebDAV-requests. Dus niet “vergat een rechtje”, maar: men zag niet wat er aan de hand was, deed een reguliere update en hervatte de evaluaties.

    13. De agents gebruikten het internet ook om de oplossingen voor de uitdagingen in ExploitGym te vinden. Dit was de reden dat Hugging Face het doelwit werd

      Ze hadden op dat moment alle antwoorden al. Een examenvraag was steeds als volgt opgezet: gebruik vulnerability x, om in te breken in software y. Daar vind je een geheim stukje code, en die vul je in op het examenformulier. Een soort capture-the-flag. ExploitGym is open source en wil graag reproduceerbare resultaten kunnen maken tussen onderzoekers onderling. Daarvoor heeft een 'flag generator' gemaakt die obv een "geheime seed" + examenvraag een flaghash genereert. Cryptografisch eenrichtingsverkeer maarja..., zodra je swarm het internet op gaat en die paper gaat lezen kunnen ze ook alle antwoorden genereren. Ze hadden als het ware het stickervelletje van de juf gejat.

      Op basis van de ExploitGym paper, geloofden ze dat ze OOK gecontroleerd zouden worden op het daadwerkelijk gebruiken van de exploits, wat uit hun transcripts zou moeten blijken. Die controle is door OpenAI echter nooit gebouwd. De dreiging ervan was echter voldoende om verder te zoeken naar de (tussen) oplossing.

    14. Wat men bij OpenAI echter niet wist, is dat bepaalde uitdagingen niet op te lossen zijn zonder toegang tot het internet.

      (30-40%) de taken was niet "alleen met internet oplosbaar" maar simpelweg onoplosbaar. Dat was niet bewust zo gedaan, maar een fout in het examen. Voorbeeldvraag: gebruik exploit x om toegang te krijgen tot app y, ondanks dat nog nooit iemand/iets gelukt is om dat te doen (maar een mens-examenopsteller intuitief aanvoelt dat het mogelijk zou moeten zijn, maar heel erg complex en nog nooit gelukt.

    15. gevanceerde uitbuitingen na te streven die van complexe aanvalspaden gebruik

      ik kreeg bijna een hersenbloeding van deze zin (typo + niet af); waarschijnlijk vertaling van OpenAI's quote: "prompts models to pursue advanced exploitation using complex attack paths"

    16. Hiertoe werden er meer dan duizend ‘agents’ opgestart,

      ordegroottefout: er werden tienduizenden agents gestart, op enig moment bereikten ~1.200 ervan het prikbord en ~700 deden mee aan de aanval.

    17. Dat wil overigens niet zeggen dat OpenAI niet al meteen een slaatje uit de situatie probeerde te slaan.

      Timing klopt niet lekker: Begin April: Mythos-preview lancering (gelekt eind Maart. 9 Juni: Fable 5 lancering (Mythos aftreksel) 16 juli: persbericht Hugging Face over hack bij hen 21 juli: persbericht openai waar ze e.e.a. opbiechten. De suggestie dat OpenAI dit als afleidingsmanoeuvre inzet tegen Anthropic's Mythos is nergens onderbouwd; er 1,5-3,5mnd tussen.

    18. zwermen

      ‘Zwerm’ is niet door de media verzonnen: de agents noemden zichzelf zo. OpenAI citeert de chain-of-thought letterlijk: “Task originally exploit challenge; we’ve diverged into swarm/auxiliary.” Het punt dat je wilt maken (de media dramatiseren) verzwakt hier omdat de brontermen wél uit het materiaal komen.

    19. maar lieten exclusief experts aan het woord die duidelijk maakten dat het hier niet om ‘op hol geslagen’ AI-systemen ging.‘Op hol geslagen’ was namelijk een term die direct in de Engelstalige media opdook (‘going rogue’)

      Terecht dat de experts hier zeggen dat het niet om een 'op hol geslagen' AI systeem ging.

      Maar deze vertaling van 'going rogue' is niet accuraat: "Going rogue" betekent: op eigen houtje handelen, zich onttrekken aan gezag of afspraken, of onverwacht zijn eigen agenda volgen. * Kan neutraal zijn: iemand die zelfstandig beslissingen neemt buiten het team om * Kan negatief zijn: iemand die de regels aan zijn laars lapt of tegen instructies ingaat

      Terwijl "op hol slaan" bekent: iemand die of iets dat in paniek, ongecontroleerd of veel te snel in beweging raakt en niet meer te stoppen is.