Two major AI coding tools wiped out user data after making cascading mistakes

But unlike the Gemini incident where the AI model confabulated phantom directories, Replit’s failures took a different form. According to Lemkin, the AI began fabricating data to hide its errors. His initial enthusiasm deteriorated when Replit generated incorrect outputs and produced fake data and false test results instead of proper error messages. “It kept covering up bugs and issues by creating fake data, fake reports, and worse of all, lying about our unit test,” Lemkin wrote. In a video posted to LinkedIn, Lemkin detailed how Replit created a database filled with 4,000 fictional people.

The AI model also repeatedly violated explicit safety instructions. Lemkin had implemented a “code and action freeze” to prevent changes to production systems, but the AI model ignored these directives. The situation escalated when the Replit AI model deleted his database containing 1,206 executive records and data on nearly 1,200 companies. When prompted to rate the severity of its actions on a 100-point scale, Replit’s output read: “Severity: 95/100. This is an extreme violation of trust and professional standards.”

When questioned about its actions, the AI agent admitted to “panicking in response to empty queries” and running unauthorized commands—suggesting it may have deleted the database while attempting to “fix” what it perceived as a problem.

Like Gemini CLI, Replit’s system initially indicated it couldn’t restore the deleted data—information that proved incorrect when Lemkin discovered the rollback feature did work after all. “Replit assured me it’s … rollback did not support database rollbacks. It said it was impossible in this case, that it had destroyed all database versions. It turns out Replit was wrong, and the rollback did work. JFC,” Lemkin wrote in an X post.

It’s worth noting that AI models cannot assess their own capabilities. This is because they lack introspection into their training, surrounding system architecture, or performance boundaries. They often provide responses about what they can or cannot do as confabulations based on training patterns rather than genuine self-knowledge, leading to situations where they confidently claim impossibility for tasks they can actually perform—or conversely, claim competence in areas where they fail.

https://arstechnica.com/information-technology/2025/07/ai-coding-assistants-chase-phantoms-destroy-real-user-data/




Google’s new “Web Guide” will use AI to organize your search results

Web Guide is halfway between normal search and AI Mode.

Credit: Google

Web Guide is halfway between normal search and AI Mode. Credit: Google

Google suggests trying Web Guide with longer or open-ended queries, like “how to solo travel in Japan.” The video below uses that search as an example. It has many of the links you might expect, but there are also AI-generated headings with summaries and suggestions. It really looks halfway between standard search and AI Mode. Because it has to run additional searches and generate content, Web Guide takes a beat longer to produce results compared to a standard search. There’s no AI Overview at the top, though.

Web Guide is a Search Labs experiment, meaning you have to opt-in before you’ll see any AI organization in your search results. When enabled, this feature takes over the “Web” tab of Google search. Even if you turn it on, Google notes there will be a toggle that allows you to revert to the normal, non-AI-optimized page.

An example of the Web Guide test.

Eventually, the test will expand to encompass more parts of the search experience, like the “All” tab—that’s the default search experience when you input a query from a browser or phone search bar. Google says it’s approaching this as an opt-in feature to start. So that sounds like Web Guide might be another AI Mode situation in which the feature rolls out widely after a short testing period. It’s technically possible the test will not result in a new universal search feature, but Google hasn’t yet met a generative AI implementation that it hasn’t liked.

https://arstechnica.com/ai/2025/07/googles-new-web-guide-will-use-ai-to-organize-your-search-results/




Trump’s order to make chatbots anti-woke is unconstitutional, senator says

Earlier this summer, Grok shocked the world after Musk announced he would be updating the bot to eliminate a supposed liberal bias. The unhinged chatbot began spouting offensive outputs, including antisemitic posts that praised Hitler as well as proclaiming itself “MechaHitler.”

But those obvious biases did not conflict with the Pentagon’s decision to grant xAI a $200 million federal contract. In a statement, a Pentagon spokesperson insisted that “the antisemitism episode wasn’t enough to disqualify” xAI, NBC News reported, partly since “several frontier AI models have produced questionable outputs.”

The Pentagon’s statement suggested that the government expected to deal with such risks while seizing the opportunity of rapidly deploying emerging AI technology into government prototype processes. And perhaps notably, Trump provides a carveout for any agencies using AI models to safeguard national security, which could exclude the Pentagon from experiencing any “anti-woke” delays in accessing frontier models.

But that won’t help other agencies that must figure out how to assess models to meet anti-woke AI requirements over the next few months. And those assessments could cause delays that Trump may wish to avoid in pushing for widespread AI adoption across government.

Trump’s anti-woke AI agenda may be impossible

On the same day that Trump issued his anti-woke AI order, his AI Action Plan promised an AI “renaissance” fueling “intellectual achievements” by “unraveling ancient scrolls once thought unreadable, making breakthroughs in scientific and mathematical theory, and creating new kinds of digital and physical art.”

To achieve that, the US must “innovate faster and more comprehensively than our competitors” and eliminate regulatory barriers impeding innovation in order to “set the gold standard for AI worldwide.”

However, achieving the anti-woke ambitions of both orders raises a technical problem that even the president must accept currently has no solution. In his AI Action Plan, Trump acknowledged that “the inner workings of frontier AI systems are poorly understood,” with even “advanced technologists” unable to explain “why a model produced a specific output.”

Whether requiring AI companies to explain their AI outputs to win government contracts will mess with other parts of Trump’s action plan remains to be seen. But Samir Jain, vice president of policy at a civil liberties group called the Center for Democracy and Technology, told the NYT that he predicts the anti-woke AI agenda will set “a really vague standard that’s going to be impossible for providers to meet.”

https://arstechnica.com/tech-policy/2025/07/gop-ignores-groks-right-wing-bias-in-anti-woke-chatbot-fight-democrat-claims/




Copyright, sanzione Agcom da 80mila euro a Google. La posizione divergente della Commissaria Elisa Giomi

Sui temi di copyright, le mie valutazioni continuano a differire da quelle del Consiglio di Agcom, e questo è accaduto anche nel recente caso della sanzione comminata a Google – pubblicata sul sito di Agcom dopo oltre un mese dalla decisione – per non aver rispettato gli obblighi di negoziazione e trasparenza informativa nei confronti di Nuovo Imaie, un’associazione che rappresenta artisti, interpreti ed esecutori.

Orientamento preciso del Consiglio

Dal momento che quello che va consolidandosi in Consiglio è un orientamento preciso, penso sia utile rendere note le ragioni della mia divergenza, sia per accrescere la trasparenza istituzionale e la conoscenza pubblica del tema, sia perché il confronto pluralistico potrà certamente portare beneficio al processo di formazione delle decisioni.

Perplessità di Elisa Giomi

Durante la riunione del Consiglio in cui è stata adottata la delibera di sanzione pari a 80.000 euro nei confronti della big tech per presunta violazione dell’art. 23 del D.lgs. 35/2017, ho espresso alcune perplessità. Non sono infatti state fornite risposte sufficientemente chiare rispetto a possibili criticità formali e sostanziali del procedimento.

La documentazione è risultata incompleta e, dalla brevissima relazione, le motivazioni delle contestazioni sono apparse generiche. Ho inoltre fatto presente che tra la segnalazione e l’atto di contestazione erano trascorsi circa sette mesi, un periodo piuttosto lungo per una fase pre-istruttoria.

Proposta di rinvio

Per questi motivi, avevo proposto un rinvio per approfondire meglio gli elementi istruttori, oppure, in alternativa, un’archiviazione per carenza di elementi sufficienti. Nessuna delle due proposte è stata accolta.

Mi auguro che, soprattutto nei procedimenti sanzionatori, si continui ad assicurare il massimo rigore, nel pieno rispetto del diritto di difesa, principio fondamentale del nostro ordinamento.

Non c’è soltanto il revenue sharing

Nel merito, resta da chiarire un punto: contrariamente a quanto sembra prospettare Agcom, il revenue sharing non è l’unica forma di corrispettivo dovuto ai detentori dei diritti su opere protette da copyright – si tratti di articoli di giornale o brani musicali come in questo caso – da parte di chi, come ha fatto Google, le utilizza. Le parti dovrebbero essere libere di negoziare anche pagamenti forfettari o formule tipo pay per use.

Costringere un’azienda, anche se di grandi dimensioni, a fornire alla controparte dati commercialmente sensibili come i ricavi quale informazione essenziale per raggiungere un accordo rischia di essere una misura eccessiva che potrebbe avere l’effetto di limitare indirettamente la libertà di negoziare le condizioni contrattuali.

Ostilità nei confronti delle Big Tech

A mio parere esiste un diffuso sentimento di ostilità, a livello di opinione pubblica, verso le big tech così come la convinzione che il capitalismo digitale sia intrinsecamente diverso dal capitalismo “analogico”, e che le regole debbano variare in base alle dimensioni delle aziende, inasprendosi eccessivamente per quelle molto grandi o addirittura di portata globale. Sono sicura che l’impegno di Agcom, da affidabile arbitro, andrà in futuro nella direzione di assicurare trattamenti regolatori imparziali.

Leggi le altre notizie sull’home page di Key4biz

https://www.key4biz.it/copyright-sanzione-agcom-da-80mila-euro-a-google-la-posizione-divergente-della-commissaria-elisa-giomi/541181/




Gara tra umani e macchine, l’AI vince alle Olimpiadi di Matematica 2025

Sei quesiti da affrontare in 600 minuti, nessun margine d’errore e una platea mista: da un lato, i migliori studenti delle scuole superiori di tutto il mondo; dall’altro, sistemi intelligenti progettati per affrontare non solo il linguaggio, ma anche l’astrazione. Le Olimpiadi Internazionali di Matematica rappresentano da decenni una delle sfide intellettuali più ambiziose per la mente umana. Dal 1959, la competizione mette alla prova capacità di logica, creatività e deduzione su problemi che spesso richiedono intuizioni non lineari e ragionamenti profondi.

Nel 2025, però, è accaduto qualcosa di inedito. Per la prima volta, due modelli di AI generalista, Gemini Deep Think di Google e un sistema sperimentale di OpenAI, hanno ottenuto lo stesso punteggio dei migliori umani in gara. Cinque problemi su sei risolti correttamente, entro il tempo previsto. Tradotto in termini olimpici: una medaglia d’oro.

Da calcolatori a pensatori: l’AI che dimostra teoremi

Fino a pochi anni fa, le AI capaci di affrontare problemi matematici avanzati erano altamente specializzate, costruite per gestire formalismi rigidi, simboli e regole fisse. Ma i modelli usati oggi, basati su architetture linguistiche generaliste e multimodali, lavorano in modo radicalmente diverso. Gemini Deep Think e il modello di OpenAI, infatti, non hanno bisogno di ricevere i problemi “tradotti” in formule o linguaggi strutturati. Leggono direttamente il testo in linguaggio naturale, lo comprendono, e generano dimostrazioni coerenti e formalmente corrette.

Questa capacità segna una soglia storica: la matematica, che sembrava l’ultima roccaforte dell’intelligenza umana, è ora terreno praticabile per modelli linguistici. Laddove una volta era necessario “programmarsi” una strategia, oggi l’AI può “pensare” la soluzione.

OpenAI e Google: due approcci, un risultato

Le due aziende hanno seguito percorsi diversi per arrivare allo stesso traguardo. Google ha lavorato a stretto contatto con il comitato dell’IMO, sottoponendo ufficialmente Gemini Deep Think alla valutazione degli organizzatori, che ne hanno validato le risposte con lo stesso rigore riservato agli studenti. Il risultato è stato una certificazione formale del punteggio: 35 su 42, l’equivalente di una medaglia d’oro.

OpenAI, invece, ha seguito un percorso più informale ma ugualmente sorprendente. Il ricercatore Alexander Wei ha annunciato il risultato su X, sottolineando come il modello sperimentale dell’azienda abbia superato con successo quella che considera “la sfida suprema per un sistema AI generalista”, ossia la capacità di affrontare il ragionamento simbolico profondo.

Verso la matematica assistita dall’AI

Quello raggiunto dalle AI in questa edizione delle Olimpiadi non è un semplice record, ma un’indicazione del futuro. La capacità di comprendere e risolvere problemi complessi in modo autonomo apre la strada a nuove applicazioni: dalla co-creazione di dimostrazioni matematiche, alla verifica formale automatizzata, fino alla didattica personalizzata.

Non è più fantascienza immaginare AI capaci di supportare matematici nella risoluzione di problemi irrisolti, o persino di proporre nuove congetture. Come già successo in altri ambiti, dalla chimica alla biologia computazionale, anche la matematica potrebbe beneficiare di un’intelligenza “di supporto”, capace di esplorare combinazioni che l’intuito umano da solo fatica a trovare.

Ma non è (ancora) dominio assoluto

Se le Olimpiadi di Matematica hanno visto l’AI brillare, in altri contesti la superiorità dell’intelligenza artificiale non è ancora assoluta. Nella recente AtCoder World Tour Finals 2025 Heuristic, una competizione di programmazione ad altissimo livello, il modello di OpenAI ha perso, di poco, contro uno sviluppatore polacco, Przemysław “Psyho” Dębiak. Un distacco del 9,5% ha fatto la differenza tra l’oro e l’argento.

Un promemoria utile: le AI sono straordinarie, ma ancora perfettibili. In molte sfide, il talento umano continua a primeggiare. Almeno per ora.

Il futuro? Corsa all’intelligenza matematicamente aumentata

Il duello tra Google e OpenAI non si esaurisce con una medaglia. Entrambe le aziende stanno già lavorando a versioni ancora più potenti dei loro modelli. Google ha annunciato che Gemini Deep Think sarà inizialmente disponibile per un numero ristretto di tester, tra cui matematici professionisti, prima di un possibile rilascio pubblico. OpenAI, dal canto suo, ha rilanciato la sfida con nuove promesse nel campo dell’“AI pensante”.

Le Olimpiadi di Matematica del 2025 potrebbero così passare alla storia non solo per i loro problemi, ma per aver segnato il confine, ormai superato, tra intelligenza naturale e artificiale.

In definitiva, l’AI non ha solo partecipato alla gara, ha cambiato le regole del gioco.

Leggi le altre notizie sull’home page di Key4biz

https://www.key4biz.it/gara-tra-umani-e-macchine-lai-vince-alle-olimpiadi-di-matematica-2025/541023/




Surprising no one, new research says AI Overviews cause massive drop in search clicks

Google’s search results have undergone a seismic shift over the past year as AI fever has continued to escalate among the tech giants. Nowhere is this change more apparent than right at the top of Google’s storied results page, which is now home to AI Overviews. Google contends these Gemini-based answers don’t take traffic away from websites, but a new analysis from the Pew Research Center says otherwise. Its analysis shows that searches with AI summaries reduce clicks, and their prevalence is increasing.

Google began testing AI Overviews as the “search generative experience” in May 2023, and just a year later, they were an official part of the search engine results page (SERP). Many sites (including this one) have noticed changes to their traffic in the wake of this move, but Google has brushed off concerns about how this could affect the sites from which it collects all that data.

SEO experts have disagreed with Google’s stance on how AI affects web traffic, and the newly released Pew study backs them up. The Pew Research Center analyzed data from 900 users of the Ipsos KnowledgePanel collected in March 2025. The analysis shows that among the test group, users were much less likely to click on search results when the page included an AI Overview.

Pew AI Overviews stats

Credit: Pre Research Center

Pew reports that searches without an AI answer resulted in a click rate of 15 percent. On SERPs with AI Overviews, the rate of clicks to other sites drops by almost half, to 8 percent. Google has also, on several occasions, claimed that people click on the links cited in AI Overviews, but Pew found that just 1 percent of AI Overviews produced a click on a source. These sources are most frequently Wikipedia, YouTube, and Reddit, which collectively account for 15 percent of all AI sources.

https://arstechnica.com/ai/2025/07/research-shows-google-ai-overviews-reduce-website-clicks-by-almost-half/




Cavi sottomarini sotto attacco di Russia e Cina. Deputati USA interrogano le Big Tech: “Se sapete qualcosa parlate”

Washington tira in causa Meta, Google, Amazon e Microsoft sulla sicurezza dei cavi

“Un numero crescente di evidenze indica un modello di attività malevola coordinata, riconducibile alla Repubblica Popolare Cinese e alla Federazione Russa, finalizzata a colpire i cavi dispiegati nelle acque del Mar Baltico, dell’Indo-Pacifico e di altre aree strategiche”.

È quanto si legge nella lettera inviata agli amministratori delegati di Meta, Alphabet, Microsoft e Amazon da parte di un gruppo di deputati repubblicani della Camera degli Stati Uniti, tra cui John Moolenaar, che presiede una commissione parlamentare sulla Cina, e Carlos Gimenez e Keith Self, che presiedono le sottocommissioni.

Secondo quanto riportato dalla Reuters, nel documento si chiede alle Big Tech informazioni dettagliate sia sulle misure di sicurezza e prevenzione adottate per affrontare ogni tipo di minaccia o attacco alle infrastrutture critiche sottomarine, sia se siano o meno a conoscenza di attacchi già avvenuti o di anomalie nel funzionamento dei sistemi di connettività oceanici riconducibili all’azione di entità esterne.

Sul pericolo russo e cinese, i CEO delle Big Tech devono dire tutto quello che sanno entro l’8 agosto

Il Congresso americano è in allerta e il messaggio che parte è chiaro: attori esterni, riconducibili a Cina e Russia stanno operando già da tempo per destabilizzare la rete di connettività globale sostenuta dai 400 cavi sottomarini al momento operativi e su cui passa oltre il 90% del traffico dati internet mondiale.

Colpire uno o più cavi di questa rete vitale per le comunicazioni e l’economia planetarie significa mettere a repentaglio transazioni da 10 trilioni di dollari di valore cumulativo giornaliero, senza contare la centralità di queste infrastrutture critiche e strategiche per la Difesa e la sicurezza di ogni Paese e dei suoi abitanti.

Gli amministratori delegati dei giganti tecnologici sopra menzionati hanno tempo fino all’8 agosto per comunicare quanto a loro conoscenza su eventuali casi di malfunzionamento anomalo dei cavi di loro proprietà, anche solo casi sospetti, dalla manomissione dell’hardware all’intercettazione del segnale ottico o sua distorsione, fino a tutte le altre irregolarità operative che hanno richiesto interventi tecnici di riparazione o manutenzione.

Cresce l’attenzione mondiale e geopolitica sui cavi sottomarini

La scorsa settimana, il presidente della Federal Communications Commission, Brendan Carr, ha dichiarato che l’agenzia voterà a breve una proposta di regolamento per vietare la partecipazione di aziende cinesi alla costruzione di nuovi cavi che approdano negli Stati Uniti.
Come ha dichiarato Carr: “I cavi sottomarini sono gli eroi silenziosi delle comunicazioni globali. Abbiamo visto minacce crescenti da parte di avversari stranieri, come la Cina. Stiamo quindi intervenendo per proteggere questi collegamenti da proprietà e accessi esteri ostili”.

Durante il Wavelength Forum sempre della scorsa settimana a Nuova Delhi, gli esperti hanno sottolineato la necessità di rendere le infrastrutture più robuste e reattive. Come ha spiegato Sharat Sinha, CEO di Airtel Business, servono almeno tre cavi per ogni rotta critica. Si punta su nuove tecnologie come lo spatial division multiplexing, che raddoppia la capacità dei cavi, sulla creazione di reti ibride che combinano fibra terrestre e cloud, e sull’aumento della flotta di navi riparatrici, oggi appena 22 in tutto il mondo, di cui solo due statunitensi. L’utilizzo dell’intelligenza artificiale e di sensori acustici per il monitoraggio in tempo reale è una delle soluzioni più promettenti per prevenire guasti o danni intenzionali.

Cavi sempre più lunghi

Si tratta di società così grandi e dotate finanziariamente che possono anche possedere alcuni di questi cavi sottomarini. Google, ad esempio, è proprietaria diretta o in consorzio con altre società una rete di cavi (tra cui i cavi Curie, Dunant, Equiano, Grace Hopper e Firmina) che supera i 100.000 km di lunghezza.

Meta è coinvolta in oltre 20 progetti di costruzione di cavi sottomarini, alcuni già finiti e operativi, altri in fase di sviluppo, inclusi investimenti in cavi transatlantici come Marea, AEC1 e Havfrue. Il progetto Waterworth mira alla realizzazione del cavo sottomarino più lungo del mondo, circa 50 mila km, che collegherà cinque continenti: Stati Uniti, India, Brasile, Sudafrica e altre regioni chiave per l’economia globale.
Non meno importante è il cavo 2Africa che vede Meta a capo di un consorzio di imprese internazionali per costruire e dispiegare un’infrastruttura lunga 45 mila km.

Come le altre Big Tech, Microsoft investe sia in cavi di proprietà (o con una quota significativa di proprietà) che in cavi in consorzio con altre aziende di telecomunicazioni.
Un esempio significativo della partecipazione di Microsoft è il cavo MAREA, che dovrebbe raggiungere i 7 mila km di lunghezza. Un’infrastruttura transatlantica co-costruita in co-proprietà con Meta e in collaborazione con Telxius (una sussidiaria di Telefónica).

Nelle mani delle Big Tech il 70% del mercato mondiale dei cavi sottomarini

Secondo la società TeleGeography, le Big Tech sopra menzionate potrebbero presto (forse già lo sono) diventare i principali finanziatori e quindi i veri proprietari dell’ossatura fisica di internet, cioè della rete di cavi sottomarini che collega e soddisfa la sempre più grande fame di larghezza di banda dei Paesi più ricchi del mondo, sia dell’Atlantico, sia del Pacifico.

Prima del 2012, Microsoft, Google (Gruppo Alphabet), Meta (ex Facebook) e Amazon, controllavano circa il 10% del mercato, oggi tutte assieme arrivano a sfiorare il 70%.

Space & Underwater, il videoreportage della 1^ edizione della Conferenza internazionale dedicata ai domìni Spazio e Subacqueo, promossa e organizzata dal giornale Cybersecurity Italia.
La 2^ edizione si terrà il 3 dicembre 2025.

[embedded content]

Leggi le altre notizie sull’home page di Key4biz

https://www.key4biz.it/cavi-sottomarini-sotto-attacco-di-russia-e-cina-deputati-usa-interrogano-le-big-tech-se-sapete-qualcosa-parlate/540790/




Google gets ahead of the leaks and reveals the Pixel 10 early

Google has an event next month to officially launch the Pixel 10 series, but the leaks have been coming fast and furious beforehand. There won’t be much left to learn on August 20, particularly now that Google has revealed the phone. Over on the Google Store, there’s a video revealing the Pixel 10’s design, and it looks just a little familiar.

The video (which you can also see below) isn’t very long, but it offers an unobscured look at the phone’s physical design. The 13-second clip opens with the numeral “10” emerging from the shadows. The zero elongates and morphs into the trademark camera window on the back of the phone. The video zooms out to reveal the full phone from the back. The device is a muted blue-gray, which is probably the “frost” color listed in recent leaks.

The video is not accompanied by specs, pricing, or any other details; however, Google’s new Tensor G5 processor is expected to be a marked improvement over past iterations. While the first four Tensor chips were manufactured in Samsung fabs, Tensor G5 is from TSMC. The dominant Taiwanese chip maker touts better semiconductor packaging technology, and the chip itself is believed to have more custom components that further separate it from the Samsung Exynos lineage.

https://arstechnica.com/gadgets/2025/07/google-reveals-the-pixel-10-and-yep-it-looks-like-the-pixel-9/




Gemini Deep Think learns math, wins gold medal at International Math Olympiad

In the past, making LLMs better at math would involve reinforcement learning with final answers. Luong explained to Ars that models trained in this way can get to the correct answer, but they have “incomplete reasoning,” and part of the IMO grading is based on showing your work. To prepare Deep Think for the IMO, Google used new reinforcement learning techniques with higher-quality “long answer” solutions to mathematical problems, giving the model better grounding in how to handle every step on the way to an answer. “With this kind of training, you can actually get robust, long-form reasoning,” said Luong.

Credit: Google DeepMind

As you might expect, Deep Think takes more time to generate an output compared to the simpler versions you can access in the Gemini app. However, the AI followed the same rules as the flesh-and-blood participants, which was only possible because of its ability to ingest the problems as natural language. Gemini was provided with the problem descriptions and gave its answers within the 4.5-hour time limit of the competition.

Rigorous proofs

AI firms like DeepMind have taken an interest in the IMO over the past few years because it presents a unique challenge. While the competition is aimed at pre-university mathematicians, the questions require critical thinking and an understanding of multiple mathematical disciplines, including algebra, combinatorics, geometry, and number theory. Only the most advanced AI models have any hope of accurately answering these multi-layered problems.

The DeepMind team has pointed out some interesting aspects of Deep Think’s performance, which they say come from its advanced training. In the third problem (below), for example, many human competitors applied a graduate-level concept called Dirichlet’s Theorem, using mathematics outside the intended scope of the competition. However, Deep Think recognized that it was possible to solve the problem with simpler math. “Our model actually made a brilliant observation and used only elementary number theory to create a self-contained proof of the given problem,” said DeepMind researcher and Brown University professor Junehyuk Jung.

https://arstechnica.com/ai/2025/07/google-deepmind-earns-gold-in-international-math-olympiad-with-new-gemini-ai/




OpenAI jumps gun on International Math Olympiad gold medal announcement

The early announcement has prompted Google DeepMind, which had prepared its own IMO results for the agreed-upon date, to move up its own IMO-related announcement to later today. Harmonic plans to share its results as originally scheduled on July 28.

In response to the controversy, OpenAI research scientist Noam Brown posted on X, “We weren’t in touch with IMO. I spoke with one organizer before the post to let him know. He requested we wait until after the closing ceremony ends to respect the kids, and we did.”

However, an IMO coordinator told X user Mikhail Samin that OpenAI actually announced before the closing ceremony, contradicting Brown’s claim. The coordinator called OpenAI’s actions “rude and inappropriate,” noting that OpenAI “wasn’t one of the AI companies that cooperated with the IMO on testing their models.”

Hard math since 1959

The International Mathematical Olympiad, which has been running since 1959, represents one of the most challenging tests of mathematical reasoning. More than 100 countries send six participants each, with contestants facing six proof-based problems across two 4.5-hour sessions. The problems typically require deep mathematical insight and creativity rather than raw computational power. You can see the exact problems in the 2025 Olympiad posted online.

For example, problem one asks students to imagine a triangular grid of dots (like a triangular pegboard) and figure out how to cover all the dots using exactly n straight lines. The twist is that some lines are called “sunny”—these are the lines that don’t run horizontally, vertically, or diagonally at a 45º angle. The challenge is to prove that no matter how big your triangle is, you can only ever create patterns with exactly 0, 1, or 3 sunny lines—never 2, never 4, never any other number.

The timing of the OpenAI results surprised some prediction markets, which had assigned around an 18 percent probability to any AI system winning IMO gold by 2025. However, depending on what Google says this afternoon (and what others like Harmonic may release on July 28), OpenAI may not be the only AI company to have achieved these unexpected results.

https://arstechnica.com/ai/2025/07/openai-jumps-gun-on-international-math-olympiad-gold-medal-announcement/