2026-04-17
AI Daily Brief
AI's Great Divergence
Lettura critica di due studi simultanei: Stanford HAI AI Index 2026 e PwC Study su leaders vs laggers. Il tema grosso del 2026 è che divari sempre più profondi si stanno aprendo tra chi sta dentro e chi sta fuori dal movimento AI.
Stanford HAI AI Index — il gap esperti/pubblico:
| Tema | Esperti positivi | Pubblico positivo |
| Impatto sul lavoro | 73% | 23% |
| Economia (20 anni) | 69% | 21% |
| Medicina | 84% | 44% |
| Educazione K-12 | 61% | 24% |
| Elezioni | 11% | 9% |
- Quasi due terzi degli adulti USA pensa che l'AI porterà a meno posti di lavoro. Sorprendentemente il 39% degli esperti è d'accordo
- Unica area senza divergenza: performance top US vs top Chinese models — essenzialmente neck and neck
- «Jagged capability frontier»: modelli che vincono l'oro alle Olimpiadi della matematica non sanno leggere con affidabilità l'ora sull'orologio
Nella stessa uscita anche: Allbirds +875%, OpenAI Agents SDK aggiornato (separa harness da compute layer, stessa mossa di Anthropic con Managed Agents), ChatGPT Ads pay-per-click, indagine CCP su Meta/Manus (founders cinesi bloccati nel paese, startup scramble a Singapore), Jensen Huang vs export control (Dwarkesh podcast).
Leggi AI Daily Brief
2026-04-18
AI Daily Brief · guida pratica
How to Use Opus 4.7 and the New Codex
Guida pratica. Due concetti chiave che cambiano il workflow:
Il «mono-thread pattern» (Nick Bauman, team Codex). Paradigma nuovo: non ogni domanda è una nuova chat. Il thread persiste nel tempo con heartbeats e thread automations. Il thread più utile di Bauman è in corso da tre settimane: controlla Slack, Gmail, PR ogni ora. Le thread automations sono trigger a intervallo su thread esistenti — accumulano contesto.
Anthony Kroger: «Può compact tre volte e il modello ricorda ancora i dettagli.»
Codex Chief of Staff recipe (Jason Liu, OpenAI). Setup: Codex ti intervista su chi sei, cosa segui, cosa ti preoccupa. Heartbeat ogni 15 minuti: il thread si sveglia, controlla le fonti, cerca richieste pendenti, blocchi, decisioni. Ti interrompe solo quando qualcosa conta davvero.
Opus 4.7 — cosa cambia in pratica su benchmark della conoscenza:
- Finance Agent: 60.1% → 64.4%
- Office QA Pro: 57.1% → 80.6%
- OS World (computer use): 72.7% → 78%
- Vending machine (economic): +20% guadagni rispetto a 4.6
- Design/visual: Mike Taylor lo chiama «il miglior PowerPoint mai visto da un LLM»
- Regressione singola: long-context retrieval 78.3% → 32.2%, ma benchmark in fase di deprecation (premia trick, non applied reasoning)
Tattica consigliata da Anthropic: delegare, non micromanagerare. Trattare il modello come un ingegnere capace a cui affidi un task, non un pair programmer da guidare riga per riga. Progressive clarification su più turni può ridurre la qualità su 4.7 — meglio mettere obiettivo completo, vincoli e criteri di accettazione in upfront.
Leggi AI Daily Brief