Nieuws

OpenAI zal Astra binnenkort lanceren, maar met een “paniekknop” die we niet hadden verwacht

Astra kreeg risiconiveau Critical na tests met twee zero-days

OpenAI zal Astra binnenkort lanceren, maar met een “paniekknop” die we niet hadden verwacht

David Bernal Raspall

  • 2 september 2026
  • Bijgewerkt: 2 september 2026 om 09:51
OpenAI zal Astra binnenkort lanceren, maar met een “paniekknop” die we niet hadden verwacht

OpenAI bereidt de lancering van Astra voor, zijn meest geavanceerde model, en dit keer gaat de kracht gepaard met een bijzonder opvallend veiligheidssysteem. Na het incident waarbij een model van OpenAI Hugging Face aanviel, heeft het bedrijf zijn controles en systemen aanzienlijk versterkt. Zodra het model openbaar beschikbaar is, zal Astra automatisch stoppen bij bepaalde acties wanneer het veiligheidssubsysteem dat nodig acht. Een soort paniekknop om zijn meest geavanceerde capaciteiten onder controle te houden.

ChatGPT Downloaden

Het eerste model van OpenAI met risico “Critical”

Volgens Axios beschouwt OpenAI Astra als het eerste model dat binnen zijn voorbereidingskader het niveau Critical bereikt. Het kan onbekende kwetsbaarheden vinden en volledig autonoom manieren ontwikkelen om die uit te buiten. Tijdens de tests wist Astra twee zero-day-kwetsbaarheden te ontdekken en aan elkaar te koppelen, een zeer aanzienlijke sprong in de ontwikkeling die we al zagen met de lancering van GPT-5.6 en ten opzichte van de cybersecuritytools van OpenAI die hebben geholpen de beveiliging van Google Chrome te verbeteren.

Als we kijken naar agenten zoals ChatGPT Work, die taken urenlang kunnen blijven uitvoeren, is de nieuwe benadering, meer gericht op voortdurende controle en niet op de initiële prompt of op de resultaten, interessant. Hoe langer een agent werkt, hoe meer wegen hij kan inslaan en hoe belangrijker het is dat het systeem elke actie die hij uitvoert tijdens zijn werk kan monitoren.

Met deze aanpak heeft OpenAI de nodige waarborgen ingebouwd om een taak bij bepaalde activiteitssignalen te kunnen vertragen, pauzeren of direct stopzetten. In ChatGPT of Codex kunnen we reageren met een verzoek om de gestopte actie te herzien, terwijl in de API de taak dan automatisch stilgelegd wordt. In beide gevallen blijven de krachtigste mogelijkheden aanvankelijk echter in handen van een kleine groep testers terwijl de nieuwe beveiligingsmaatregelen verder worden aangescherpt.

Laatste artikelen

Volgende artikel wordt geladen

Aangemeld bij Softonic als