AI News

222

Meta testar Muse AI‑agentens samtal som faktiskt utförs av människor i ett callcenter

Meta testar Muse AI‑agentens samtal som faktiskt utförs av människor i ett callcenter
Mastodon +7 källor mastodon
agentsmeta
Meta testar i hemlighet en ny version av sin personliga AI‑assistent, Muse, som dirigerar telefonförfrågningar till mänskliga operatörer i ett callcenter i stället för att låta mjukvaran ringa upp och föra samtalet själv. Ett internt inlägg på medarbetarens anslagstavla, som 404 Media har sett, förklarar att Muse nu “överlämnar förfrågningar till en tränad mänsklig agent, som ringer samtalet och hanterar det”, och att funktionen fortfarande är en konfidentiell produkt före lansering. Medier som uppskattar fördelningen mellan AI och mänsklig insats säger att ungefär 70 procent av agentens uppgifter fortfarande utförs av personer. Uppenbarelsen följer Metas senaste patch mot Muse‑exploiten som gjorde det möjligt för angripare att ta kontroll över agenten, en händelse vi rapporterade den 22 september. Den belyser ett växande mönster i branschen: ambitiösa påståenden om autonom AI döljer ofta betydande mänskligt arbete bakom kulisserna. Genom att positionera mänskliga operatörer som en “mänsklig concierge” kan Meta kringgå tekniska hinder såsom fel i taligenkänning, regulatoriskt motstånd mot oönskade robocalls och behovet av robusta säkerhetsåtgärder innan en fullt autonom utrullning. Meta säger att medarbetarfeedbacken på testet har varit “överväldigande positiv” och presenterar provet som ett sätt att samla in data om säkerhets- och integritetsskydd. Företaget har inte avslöjat när – eller om – den helt AI‑drivna samtalsfunktionen kommer att släppas. Vad man bör hålla ögonen på härnäst: om Meta expanderar modellen med människa i loopen till andra Muse‑funktioner, hur regulatorer reagerar på blandningen av AI‑löften med mänskligt arbete, och om företaget kommer att publicera prestationsmått som kan påverka den bredare debatten om AI‑transparens och etiken kring “spöklik” automation.
149

Personer som tränar OpenAIs AI avskedade för att använda AI i träningen

Personer som tränar OpenAIs AI avskedade för att använda AI i träningen
Mastodon +6 källor mastodon
openaitraining
OpenAI har avskedat ett antal entreprenörer efter att ha upptäckt att de använde artificiella‑intelligensverktyg för att utföra det mänskliga återkopplingsarbete de anlitades för. Entreprenörerna, rekryterade via arbetsplattformen Mercor för att läsa riktiga ChatGPT‑promptar och bedöma modellens svar, skulle leverera “endast mänskliga” bedömningar. Enligt en rapport från 404 Media bröt flera av dem mot den regeln genom att använda AI för att poängsätta eller generera återkoppling, vilket fick OpenAI att säga upp deras kontrakt. Avskedandena belyser en växande spänning i företagets data‑träningspipeline. OpenAIs modeller är fortfarande starkt beroende av mänskliga annotatörer för att leverera högkvalitativa, opartiska signaler som styr modellens beteende och säkerhet. Att införa syntetiska, av AI genererade bedömningar riskerar att förorena träningsdatamängden med återkoppling som kan förstärka befintliga fördomar eller dölja fel, vilket undergräver tillförlitligheten i processen med mänsklig inblandning. Åtgärden understryker också ett paradoxalt förhållningssätt: OpenAI uppmuntrar offentligt bred adoption av AI på arbetsplatser samtidigt som de kontrollerar sin egen arbetskraft mot samma praxis. Denna utveckling följer OpenAIs tidigare tillkännagivande om att tillåta tredje‑partsgrupp att genomföra tekniska säkerhetsutvärderingar av sina modeller, och den sammanfaller med en separat rapport från den 22 september om att företaget avskedade entreprenörer för liknande överträdelser. Mönstret tyder på att OpenAI skärper tillsynen av sitt annoterings‑ekosystem i takt med att nya modellutgåvor skalar upp. Observatörer kommer att hålla ögonen på ett formellt svar från OpenAI som redogör för reviderade riktlinjer för entreprenörer och eventuella bredare policyförändringar kring användning av AI i träningspipelines. Händelsen kan också få andra AI‑företag att ompröva hur de balanserar automatiseringens effektivitet med behovet av oklanderlig mänsklig återkoppling, en debatt som kan forma branschens sätt att utveckla modeller under kommande månader.
143

Pentagon: Överdriven tillit till AI bidrog till missilangrepp mot iransk skola

Pentagon: Överdriven tillit till AI bidrog till missilangrepp mot iransk skola
HN +6 källor hn
Pentagons egna utredare har dragit slutsatsen att en överdriven tillit till verktyg för artificiell intelligens bidrog till det missilangrepp i februari som träffade Shajarah Tayyebeh grundskola i Minab, Iran, och dödade 123 barn. Granskningen visade att bristfällig underrättelseinformation, föråldrade satellitbilder och ett starkt beroende av ett Palantir AI‑system samverkade för att felidentifiera målet som en legitim militär anläggning. Resultatet bygger på den rapport vi publicerade den 19 september, då amerikanska tjänstemän uppgav att Palantirs Maven AI var en av faktorerna bakom samma angrepp. Den nya rapporten lägger till detaljer om den ”dödkedja” som gick från föråldrade data till ett automatiserat beslutsfattande lager, och belyser hur semi‑autonom målutpekning kan förstärka mänskliga fel. En ukrainsk drönarutvecklare citerade händelsen som ett varningsexempel på farorna med semi‑autonom krigföring. Konsekvenserna är omedelbara för Pentagons bredare AI‑drivna målutpekning. Lagstiftare och försvarsgranskare kommer sannolikt att kräva striktare tillsyn av AI‑assisterade vapensystem, och tjänstegrenarna kan tvingas revidera protokoll som för närvarande tillåter AI‑utdata att påverka strike‑beslut med begränsad mänsklig verifiering. Håll utkik efter ett formellt svar från Försvarsdepartementet om hur de kommer att justera sina AI‑upphandlingar och operativa riktlinjer, samt eventuella kongressförhör som kan omforma det juridiska ramverket för autonoma vapen. Händelsen väcker också utsikterna till ytterligare rättsliga processer mot AI‑leverantörer, i likhet med den nyliga stämningen som inbringats av British Columbia över en orelaterad skolskjutnings‑AI‑incident. Minab‑tragedin kan bli ett avgörande ögonblick i debatten om hur långt den amerikanska militären bör låta algoritmer styra dödligt våld.
130

Scott Bessent kan snart bli Trumps AI-czar, enligt rapport

Scott Bessent kan snart bli Trumps AI-czar, enligt rapport
Mastodon +6 källor mastodon
USA:s finansminister Scott Bessent framträder som huvudkandidaten för att bli president Donald Trumps nyinrättade “AI-czar”, enligt en anonym rapport från Semafor. Historien, som återges av flera medier, säger att Vita huset överväger Bessent för en senior roll som skulle samordna federala AI-politik, reglering och strategiska initiativ. Bessents namn har redan dykt upp i högt profilerade AI-debatter. Som vi rapporterade den 21 september berättade han för lagstiftare att Washington hade föreslagit en AI‑incidentrapportering till Kina och att båda sidorna rörde sig mot ett bilateralt AI‑dialog. Han försvarade också OpenAIs hantering av ett säkerhetsintrång i juli och hävdade att ansvaret låg på företagets ledning snarare än externa aktörer. Dessa insatser signalerar en växande vilja att placera en senior ekonomisk tjänsteman i centrum för AI‑styrning, ett steg som kan stärka samordningen mellan fiskalpolitik och övervakning av framväxande teknik. Om tillsättningen bekräftas skulle den ge Finansdepartementet en direkt roll i att utforma regler för dataskydd, exportkontroller och AI‑drivna finansiella tjänster, områden som traditionellt har delats upp mellan flera myndigheter. Det understryker också Trump‑administrationens avsikt att centralisera AI‑strategin under en enda myndighet, i kontrast till den mer spridda modellen i tidigare administrationer. Håll utkik efter ett officiellt tillkännagivande från Vita huset de kommande veckorna, samt eventuella lagstiftande svar från Kongressen, som har uttryckt oro över att koncentrera AI‑tillsyn i ett enda kontor. Ytterligare ledtrådar kan dyka upp i kommande Finansdepartementets briefingar om AI‑relaterad finansiell risk och i administrationens bredare teknikagenda inför nästa valcykel.
125

Ny AI‑agent från Rabbit klarar sig utan R1

Ny AI‑agent från Rabbit klarar sig utan R1
Mastodon +6 källor mastodon
agentsapple
Rabbit, startupen bakom den kortlivade handhållna AI‑enheten R1, har lanserat ett nytt “agentbaserat operativsystem” kallat OS3. Till skillnad från sin föregångare är OS3 en ren mjukvarubaserad AI‑agent som körs i molnet men exekveras lokalt på Windows‑, macOS‑ och Linux‑datorer. Detta innebär att användare inte längre behöver Rabbits egen hårdvara för att få tillgång till dess konversationsfunktioner. Skiftet är viktigt eftersom det indikerar en bredare branschtrend bort från dedikerade AI‑apparater till plattformsoberoende tjänster som kan utnyttja befintliga enheter. Rabbits R1 hade svårt att få fäste, och företagets vändning mot en molnbaserad, hårdvaruoberoende modell kan återuppliva dess relevans och bredda användarbasen. Genom att utnyttja samma underliggande modeller som drev R1 men leverera dem via en lättviktig klient, siktar Rabbit på att konkurrera med andra framväxande agentbaserade plattformar såsom Metas Muse och Snorkel AIs data‑utvecklingsagenter, som också går mot mer tillgängliga, enbart mjukvarubaserade distributioner. Det som bör bevakas härnäst är hur OS3 presterar i verklig användning, om Rabbit kan locka utvecklare att bygga på plattformen, och hur snabbt de kan säkra partnerskap med stora OS‑leverantörer. Observatörer kommer också att vara nyfikna på om företaget offentliggör pris‑ eller prenumerationsinformation, samt om agenten kan integreras med befintliga produktivitetsverktyg. Lanseringen kommer att testa om en enbart mjukvarubaserad strategi kan övervinna den marknadsresistens som hindrade R1, och kan sätta en standard för framtida AI‑agent‑erbjudanden.
123

Löste OpenAI fel Navier‑Stokes‑problem?

Mastodon +7 källor mastodon
openai
OpenAI meddelade att en svärm av sina AI‑agenter hade producerat ett 166‑sidigt bevis, formellt verifierat i Lean‑teoremprovaren, som de påstod löste Navier‑Stokes‑problemet – en av de sju Millenniumpristävlingarna som erbjuder en US $1 miljon‑belöning från Clay Mathematics Institute. Påståendet, som offentliggjordes i ett blogginlägg för två veckor sedan, väckte stor entusiasm i både AI‑ och matematikgemenskaperna, med rubriker som antydde att en maskin äntligen hade knäckt ett problem som mänskliga experter har undgått i ett sekel. Inom några dagar granskade tre matematiker inlämningen och drog slutsatsen att beviset kringgick huvudfrågan snarare än att leverera en definitiv lösning. Deras kritik, som återfinns i flera tekniska kommentarer, pekar på luckor i argumentets omfattning och på oklarheter kring vilken variant av Navier‑Stokes‑ekvationerna AI behandlade. Clay Institute har ännu inte erkänt någon lösning, och OpenAI har uttryckligen sagt att de inte avser att kräva priset. Händelsen är viktig av två skäl. För det första visar den hur storskaliga språkmodellsystem kan generera sofistikerad formell matematik, vilket öppnar för AI‑assisterad upptäckt. För det andra understryker den svårigheten att validera maskinproducerade bevis, särskilt när arbetet berör djupa, olösta frågor där kraven på stringens fortfarande diskuteras. Framöver kommer matematikgemenskapen sannolikt att genomföra en formell kollegial granskning av det Lean‑verifierade beviset, medan OpenAI kan finjustera sin verifieringspipeline för att bemöta de framlagda invändningarna. Observatörer kommer också att följa om Clay Mathematics Institute uppdaterar sina riktlinjer för AI‑genererade inlämningar, och om andra forskningsgrupper försöker oberoende replikera resultatet. Resultatet kommer att forma förväntningarna på AI roll i att lösa världens mest envisa matematiska problem.
87

AI‑startupen Micro1 får mer än 100 M$ och värderas till 4 mdr $ efter att ha ökat från 500 M$ i September 2025

Techmeme +7 källor techmeme
startuptraining
Micro1, startupen för träningsdata från AI som grundades av Ali Ansari, har avslutat en finansieringsrunda på över 100 miljoner dollar och lyfter sin värdering till cirka 4 miljarder dollar. Kapitalanskaffningen följer en meteoritisk intäktstillväxt: företaget, som i början av förra året var en blygsam rekryteringsverksamhet med 7 miljoner dollar i årlig återkommande intäkt (ARR), rapporterar nu ARR över 500 miljoner dollar. Under de senaste åtta månaderna har den bruttoårliga omsättningshastigheten skjutit i höjden från 100 miljoner till 500 miljoner dollar, en femfaldig expansion, medan de automatiserade dataset‑pipelinesna enligt uppgift levererar bruttomarginaler på 80‑90 procent. Affären understryker den blomstrande marknaden för högkvalitativ träningsdata i takt med att generativa AI‑modeller sprider sig. Genom att erbjuda mänskligt kuraterade och AI‑förstärkta märktjänster har Micro1 positionerat sig som en direkt konkurrent till etablerade aktörer som Scale AI, och lockar investerare som vill stödja den infrastruktur som ligger till grund för nästa våg av utveckling av stora språkmodeller. Värderingsökningen – från 500 miljoner dollar i september 2025 till 4 miljarder dollar – signalerar starkt förtroende för att datacentrerade startups kan skala lönsamt, ett narrativ som förstärks av den senaste stora kapitalanskaffningsaktiviteten i sektorn. Framöver kommer analytiker att bevaka om Micro1 använder det nya kapitalet för att bredda sitt nätverk av entreprenörer, fördjupa automatiseringen eller genomföra strategiska förvärv som kan befästa dess marknadsledarskap. Företagets nästa finansieringsrunda, eventuella börsnotering och eventuella partnerskapsannonser med stora AI‑modellbyggare blir nyckelindikatorer för hur ekosystemet för datamärkning konsolideras när efterfrågan på allt större modeller accelererar.
73

DeepSeek Elastic Compute (DSec): Sandboxinfrastruktur för effektiv agentbaserad träning i stor skala

Mastodon +6 källor mastodon
agentsdeepseektraining
DeepSeek har lanserat en ny sandboxplattform avsedd att förenkla storskalig agentbaserad träning för stora språkmodeller (LLMs). I en artikel publicerad på arXiv den 19 september 2026 beskriver företaget DeepSeek Elastic Compute (DSec) som en produktionsklassad infrastruktur som låter forskare och ingenjörer köra, utvärdera och bygga miljöer för LLM‑agenter i stor skala. DSec presenterar ett enhetligt utvecklingskit (SDK) som kan dirigera arbetsbelastningar till en rad olika exekveringsbakgrunder – inklusive funktion‑anropsgränssnitt, behållare, mikro‑virtuella maskiner och fullständiga virtuella maskiner – vilket ger användarna möjlighet att välja den nivå av isolering, kompatibilitet och prestanda som varje uppgift kräver. Meddelandet är viktigt eftersom den snabba ökningen av ”agentiska” LLMs‑modeller som kan planera, agera och interagera med externa verktyg har överträffat tillgängligheten av säkra, elastiska beräkningsmiljöer. Existerande molntjänster tvingar ofta ett en‑storlek‑passar‑alla‑tillvägagångssätt, vilket skapar flaskhalsar för utvecklare som behöver både hög genomströmning för träning och strikt sandboxing för säkerhet eller efterlevnad. Genom att abstraktera flera sandbox‑teknologier bakom ett enda SDK lovar DSec att minska ingenjörsbelastningen, förbättra resursutnyttjandet och underlätta verkställandet av isoleringspolicyer både under träning och efterträningsevaluering. Plattformen speglar också bredare branschtrender mot modulära, säkerhetsfokuserade verktyg, såsom Snorkel AIs agentiska datautvecklingsplattform och OpenAIs plan att låta tredje parter genomföra tekniska säkerhetsgranskningar. Det som blir intressant att följa är om DSec kommer att erbjudas som en molntjänst eller förbli ett internt verktyg för DeepSeek egna modeller, samt hur snabbt externa utvecklare tar till sig SDK för sina egna agentiska projekt. Branschobservatörer kommer också att hålla utkik efter eventuella partnerskap som integrerar DSec med framväxande ramverk för säkerhetsevaluering, samt potentiell regulatorisk uppmärksamhet med tanke på den ökande granskningen av LLM‑agenter som opererar i öppna miljöer.
59

Trump: Artificiell intelligens blir superintelligens i statliga dokument

Gizmodo +9 källor 2026-09-22 news
President Donald Trump använde sitt framträdande vid FN:s generalförsamling för att meddela att ”artificiell intelligens” kommer att omdöpas till ”superintelligens” i alla amerikanska statliga dokument. Deklarationen, som gjordes på tisdagen, presenterades som en enkel omprofilering och placerades som en del av en bredare insats för att bemöta den växande allmänna oron kring AI‑teknologier. Beslutet har omedelbart väckt förvirring bland forskare och tekniker eftersom ”superintelligens” redan har en specifik betydelse inom området. Filosofen Nick Bostroms bok från 2014, *Superintelligence: Paths, Dangers, Strategies*, definierar begreppet som varje intelligens som vida överträffar mänsklig kognition på praktiskt taget alla områden. Genom att ta över uttrycket för byråkratisk märkning riskerar administrationen att sudda ut gränsen mellan en politisk etikett och ett tekniskt koncept som ligger till grund för den pågående debatten om AI‑säkerhet och styrning. Betydelsen är tvåfaldig. För det första formar terminologin hur beslutsfattare och allmänheten uppfattar framväxande teknologier; en övergång till ”superintelligens” kan förstärka upplevda hot och påverka framtida regleringsstrategier. För det andra kom tillkännagivandet utan någon medföljande verkställighetsorder eller konkret genomförandeplan, vilket lämnar myndigheterna osäkra på hur den nya benämningen ska tillämpas i praktiken. Det som bör bevakas härnäst är om Vita huset utfärdar formell vägledning eller en verkställighetsdirektiv, hur federala departement anpassar sin dokumentation, samt reaktionen från AI‑forskningsgemenskapen och internationella partners. Observatörer kommer också att följa eventuella lagförslag som refererar till den nya terminologin, liksom den bredare berättelsen kring AI‑tillsyn som har lyfts fram i senaste rapporteringen, inklusive vårt artikel från 23 sep som behandlar Trumps potentiella roll som ”AI‑czar”.
57

OpenAI lanserar GPT‑6 Sol och Luna med lägre kostnad och färre fel

TechCrunch +5 källor techcrunch
openai
OpenAI meddelade på tisdagen att två nya modeller har lagts till i dess GPT‑6‑familj – Sol och Luna – och presenterar dem som kostnadseffektiva alternativ till den nyligen lanserade GPT‑6 Astra. Företaget säger att de nya varianterna behåller ”frontier‑intelligens” från Astra‑serien samtidigt som priset sänks till ungefär hälften av de tidigare 5.6‑seriens Sol‑ och Luna‑erbjudandena. OpenAI tillskriver besparingarna framsteg inom cachning och inferens som effektiviserar modellernas beräkningsvägar. Lanseringen följer utrullningen av GPT‑6 Astra tidigare i månaden, som OpenAI marknadsförde som sin mest kraftfulla och mångsidiga modell för uppgifter som sträcker sig från allmänna arbetsuppgifter till programvaruutveckling. Genom att utöka GPT‑6‑serien med billigare men fortfarande högpresterande alternativ vill OpenAI bredda tillgången till sin senaste generation av språkmodeller, vilket potentiellt kan snabba på antagandet i företags‑ och utvecklarekosystem som är känsliga för kostnaden för 5‑seriens modeller. Tidpunkten är anmärkningsvärd: Sol och Luna släpptes minuter efter att Anthropic presenterade sitt eget flaggskepp, Claude Opus 5.5, vilket tyder på ett konkurrensdrivet tryck bland ledande AI‑labben för att ta marknadsandelar med nyare, mer effektiva erbjudanden. Observatörer kommer att följa hur pris‑ och prestandakrav översätts till verklig användning, särskilt när företag utvärderar om kostnadsgapet minskar hindret för att distribuera storskaliga språkmodeller. Viktiga signaler att bevaka inkluderar antagningsstatistik för Sol och Luna, eventuella tredjeparts‑säkerhetsutvärderingar som annonseras under OpenAI’s senaste policy för att tillåta externa granskningar, samt huruvida den lägre prisstrukturen leder till en förändring av prissättningsstrategierna för branschens flaggskeppsmodeller.
52

Rabbit lanserar OS3 – molnbaserad AI‑agent för Windows, Mac och Linux via webben, Telegram eller R1‑enheten (Julian Chokkattu/Wired)

Techmeme +6 källor techmeme
agents
Rabbit har lanserat OS3, en molnbaserad AI‑agent som kan nå in i lokala program och filer på Windows, macOS och Linux‑maskiner. Tjänsten nås via en lättviktig lokal Rabbit‑agent som installeras med ett enda kommando, och användare kan interagera med assistenten via en webbportal, Telegram, iMessage eller företagets ursprungliga R1‑handhållare. Ett konto kan koppla upp till fem enheter, och plattformen bestämmer om en uppgift körs på användarens dator, en virtuell maskin i molnet eller en dedikerad AI‑box, och flyttar filer, appar och ”skills” mellan miljöer efter behov. Lanseringen markerar ett skifte från Rabbits tidigare hårdvaruförst‑strategi. Som vi rapporterade den 23 september 2026 kunde företagets tidigare agent fungera utan R1‑enheten, men OS3 är det första fullt plattformsoberoende erbjudandet som helt eliminerar behovet av dedikerad AI‑hårdvara. Genom att förena molnintelligens med lokala programvaror vill Rabbit göra AI‑drivna produktivitetsverktyg användbara på de skärmar folk redan äger, snarare än att kräva en separat enhet. Flytten är viktig eftersom den sänker tröskeln för AI‑assistenter i vardagliga arbetsflöden och placerar Rabbit i direkt konkurrens med andra framväxande agenter såsom OpenAIs GPT‑6 Sol och Luna, DeepSeeks Elastic Compute‑sandlåda och Metas Muse‑experiment. Om OS3 lever upp till sitt löfte om sömlös uppgiftsdirigering och säker lokal åtkomst kan det påskynda antagandet av AI‑förstärkta skrivbordsarbeten i Norden och bortom. Det som bör hållas ögonen på härnäst är hur snabbt användare antar den multi‑enhetsmodellen, huruvida utvecklare bygger tillägg som utnyttjar den tvärmiljö‑orkestreringen, samt hur Rabbit hanterar säkerhets- och integritetsfrågor kring molnmedierad kontroll av lokala filer. Uppföljande uppdateringar om prestandamått, prissättning och eventuella företagsfunktioner kommer att avgöra om OS3 omformar AI‑assistant‑landskapet.
39

Grounded Action Model: 3D‑förankring som grund för robotik

HF Papers +6 källor hf papers
robotics
En ny klass av robot‑grundmodeller har presenterats under namnet Grounded Action Model (GAM). Forskningen föreslår “3‑D‑förankring” som den centrala byggstenen för robotåtgärdsinlärning, och ersätter de språk‑ och videogenererings‑ryggradar som dominerar nuvarande vision‑språk‑åtgärd (VLA) och värld‑åtgärd (WAM) modeller. GAM kan styras med naturligt språk, punktklick eller avgränsningsruteselecteringar, där varje inmatning översätts till en delad, objekt‑centrerad representation av de valda objekten i metrisk 3‑D‑rymd. Skiftet är betydelsefullt eftersom manipuleringspolicyer måste veta inte bara vilka objekt som är relevanta utan också exakt var de befinner sig. Existerande förtränade ryggradar påtvingar inte denna metriska förankring, vilket leder till bräcklig prestanda när scener förändras eller mål flyttas. Genom att anknyta policyer till en förtränad, promptbar 3‑D‑förankringsmodell länkar GAM direkt visuella observationer och uppgiftspromptar till konkreta rumsliga koordinater. Tidiga demonstrationer visar förbättrad robusthet mot scenvarianter och målflyttning, vilket pekar på en väg mot mer pålitlig robotmanipulation i ostrukturerade miljöer. Arbetet signalerar också en bredare rörelse mot öppna källkod 3‑D‑visionsgrunder som naturligt förstår rörelse, struktur och utseende. Eftersom modellen och dess träningspipeline släpps offentligt kan robotikgemenskapen testa tillvägagångssättet på en rad plattformar, från forskningslaboratorier till edge‑enheter. Framöver bör observatörer hålla utkik efter benchmarkresultat som jämför GAM med etablerade VLA‑ och WAM‑system, efter integrationsinsatser med befintliga robotstackar, samt efter eventuella uppföljande releaser som utökar den promptbara 3‑D‑förankringsmodellens kapabiliteter. Om de tidiga vinsterna håller i sig kan 3‑D‑förankring bli standardunderlaget för framtida robotstyrning, och omforma hur manipuleringspolicyer tränas och implementeras.
37

Deep Persona: Psykologiskt förankrad arkitektur och utvärderingsram för rollspelsagenter

HF Papers +5 källor hf papers
agentscohere
Ett nytt forskningspapper presenterar Deep Persona, en trelagrad arkitektur som syftar till att ge stora språkmodeller (LLM)-agenter en mer bestående karaktärsuppfattning. Ramverket delar upp en persona i observerbart uttryck, latenta övertygelser och grundläggande motivationsdrivkrafter, och kopplar denna hierarki till en regeluppsättning för manusstyrd determinism som begränsar beslutsutrymmet. Genom att förankra en agents svar i ett internt manus snarare än i ad‑hoc‑promptar hävdar författarna att modellen kan upprätthålla sammanhängande beteende under långa, öppna konversationer – något som nuvarande persona‑simuleringsmetoder har svårt att uppnå. Utvecklingen är viktig eftersom många framväxande tillämpningar – personliga assistenter, simuleringar av socialt beteende, interaktiva rollspels‑botar och verktyg för justeringsforskning – förlitar sig på LLMs som kan övertygande anta och behålla en karaktär. Ytliga beskrivningar leder ofta till drift, vilket bryter immersionen och undergräver förtroendet. Deep Personas psykologiskt förankrade design lovar mer stabila, mänskliga interaktioner och kan höja ribban för både kommersiella produkter och forskningsprototyper som är beroende av trovärdiga syntetiska agenter. Papprendet introducerar också ett utvärderingsramverk för att mäta konsistens, trovärdighet och justering hos de genererade personorna, vilket ger ett referensmått för framtida arbete. Observatörer kommer att följa hur arkitekturen integreras i befintliga agentplattformar, såsom de data‑utvecklingspipeline som framhölls i vår senaste rapportering om Snorkel AI, och om den kan skalas med infrastrukturer som DeepSeek Elastic Compute. Ytterligare validering i verkliga implementationer – från kundtjänst‑botar till storskaliga beteendesimuleringar – kommer att visa om Deep Persona kan bli en standardkomponent för nästa generations rollspelsagenter.
34

Firecrawl får 75 miljoner dollar i Series B‑finansiering ledd av Smash Capital (Maria Deutscher/SiliconANGLE)

Techmeme +6 källor techmeme
agentsfundingstartup
Firecrawl, en startup som bygger webb‑skrapningsinfrastruktur för artificiella intelligens‑agenter, meddelade en finansieringsrunda på 75 miljoner dollar i Series B ledd av det Los Angeles‑baserade riskkapitalföretaget Smash Capital. Kapitaltillskottet följer lanseringen av ”Alexandria”, ett data‑åtkomstlager som samlar mer än hundra källor — inklusive det levande webben, officiella dataleverantörer och Firecrawls egna index — i ett enda API som AI‑agenter kan fråga. Finansieringen understryker den växande efterfrågan på färdiga datapipelines som låter generativa modeller gå bortom statiska träningsdatamängder och hämta uppdaterad information på begäran. Genom att abstrahera mekanismerna för att crawla, parsa och normalisera webb­innehåll syftar Firecrawl till att avlasta utvecklare från att bygga skräddarsydda scrapers för varje nytt användningsfall. Alexandrias enhetliga gränssnitt lovar att påskynda skapandet av ”agentiska” applikationer som behöver surfa, verifiera eller förstärka sin kunskap i realtid, en förmåga som blir en differentieringsfaktor för produkter som sträcker sig från chatt‑baserade assistenter till autonoma forsknings‑botar. Investerarna verkar övertygade om att tjänsten kommer bli ett grundläggande lager för nästa våg av AI‑agenter, särskilt när företag vill integrera levande dataflöden utan att utsättas för de juridiska och tekniska komplexiteterna i storskalig crawling. Rundan signalerar också förtroende för den bredare marknaden för specialiserade data‑som‑en‑tjänst‑plattformar som ligger mellan rå webb­innehåll och AI‑modeller. Framöver kommer branschen att följa hur snabbt utvecklare antar Alexandria och om plattformen kan säkra partnerskap med stora dataleverantörer. Lika viktigt blir hur Firecrawl navigerar de föränderliga webb‑skrapnings‑reglerna och konkurrensen från större molnleverantörer som lanserar sina egna data‑åtkomst APIs. Företagets nästa milstolpar — produktintegrationer, kundvinster och eventuell uppföljningsfinansiering — kommer att visa om deras vision om ett universellt datalager för AI‑agenter kan skalas.
33

Låt dig inte luras av sommarens AI‑hype

MIT Tech Review +5 källor mit tech review
anthropicclaudehuggingfacemetaopenai
En våg av djärva påståenden har svept över AI‑sektorn i sommar, men en närmare granskning tyder på att många av rubrikerna är mer hype än hårda bevis. I slutet av april annonserade Anthropic att deras nya modell, Claude Mythos, kunde upptäcka mjukvarusårbarheter bättre än de flesta mänskliga säkerhetsexperter. Påståendet väckte rubriker och investerarnas optimism, men teknikpressen har redan börjat ifrågasätta robustheten i bevisen bakom det. Hypen undergrävdes ytterligare av en uppmärksammad säkerhetsincident som involverade OpenAI‑ och Hugging Face‑modeller, vilket visade hur lätt AI‑system kan komprometteras. I efterdyningarna avslöjade Anthropic – “stolt” – och Meta – “motvilligt” – liknande säkerhetsincidenter som drabbade deras egna modeller. Mönstret av höga löften följda av snabba erkännanden av svagheter har fått analytiker att varna för att sommaren AI‑entusiasm kan vara överdriven. Det är viktigt av två anledningar. För det första kan uppblåsta prestandapåståenden vilseleda företag att implementera verktyg som ännu inte är stridstestade, vilket potentiellt kan utsätta kritisk infrastruktur för nya attackvektorer. För det andra belyser upprepade säkerhetsluckor ett systematiskt gap i hur AI‑utvecklare skyddar sina modeller, vilket väcker oro bland både tillsynsmyndigheter och kunder. Framåt ser branschen ett tryck att styrka sina påståenden med transparenta referensramar och oberoende granskningar. Observatörer kommer att följa upp studier som antingen bekräftar eller förkastar Anthropic‑påstående om sårbarhetsdetektering, samt för eventuella samordnade svar från stora aktörer för att stärka modellens säkerhet. Technology Reviews senaste rapport, som återges av AI Weekly och AI Foresights, uppmanar intressenter att tränga igenom sommarhypen och fokusera på vad AI kan leverera pålitligt idag.
31

HuRo: Robotiserar mänskliga videor för skalbar VLA‑förträning

HF Papers +6 källor hf papers
alignmenttraining
En ny forskningsinsats kallad **HuRo** visar att enorma samlingar av vardagliga mänskliga videor kan omvandlas till robotklara träningsdata för vision‑språk‑aktionspolicyer (VLA). Genom att konvertera 630 000 videoavsnitt—sammanlagt 142 miljoner bildrutor—till robotanpassade observationer, handlingar och språk­instruktioner visar teamet att en ökning av denna ”robotiserade” data förbättrar prestandan på verkliga manipuleringsuppgifter. Metoden tar itu med ett långvarigt flaskhals i robotinlärning: högkvalitativ robotinteraktionsdata är dyra och begränsade i variation, medan mänskliga videoarkiv är rikliga men inkorporerade på ett annat sätt. HuRo extraherar först kameraposition och handbanor från egocentrisk filmning, isolerar manipuleringssegmenten och omvandlar sedan den mänskliga handrörelsen till robotleds‑banor. Mänskliga armar tas bort från bildrutorna och en syntetisk robot renderas på deras plats, vilket ger avsnitt som kombinerar visuellt material, språkkommandon och robothandlingar. Förträning av VLA‑policyer på större delmängder av dessa robotiserade avsnitt ger konsekvent högre framgångsfrekvens när policyerna senare används på fysiska robotar. Utvecklingen är viktig eftersom den erbjuder en skalbar, kostnadseffektiv väg att berika robotinlärningskedjor med mångfalden av mänsklig aktivitet. Om metoden generaliseras över domäner kan den påskynda införandet av anpassningsbara robotassistenter i hem och industri, vilket minskar beroendet av kostsamma datainsamlingskampanjer. Framtida bevakningspunkter inkluderar om HuRo‑pipeline kan integreras med befintliga robotinlärningsplattformar, hur den presterar på mer komplexa uppgifter, och om andra grupper kommer att anta liknande människa‑till‑robot‑videokonverteringstekniker. Gemenskapen kommer också att vilja se jämförelsesätt som jämför HuRo‑förtränade policyer med de som tränats på traditionella robotdatamängder, samt om metoden kan utökas till multimodala indata som ljud eller taktil återkoppling.
28

Trump avvisar globalt kontrollprogram för AI i UN‑talet och påstår att US ligger långt före Kina

Techmeme +6 källor techmeme
speech
President Donald Trump använde sina avslutande anföranden vid FN:s generalförsamling på tisdagen för att fördöma internationella försök att reglera artificiell intelligens. ”US förkastar fullständigt alla försök att konstruera ett globalistiskt program för att kontrollera artificiell intelligens”, sade han och tillade att Amerika ”nu ligger långt före Kina och alla andra – och vi kommer att behålla det så”. Presidenten beskrev också AI som ”superintelligens” som USA kommer att dominera. Trumps uttalanden kommer i ett ögonblick då en våg av krav på samordnad tillsyn av AI får ökat stöd i Europa och Asien, där regeringar utarbetar standarder för säkerhet, datanvändning och exportkontroller. Genom att karakterisera multilaterala regleringar som ett ”globalistiskt program” signalerar presidenten en fortsättning på sin administrationens ensidiga hållning gentemot framväxande teknologier. Positionen sammanfaller med tidigare rapportering om att Trump redan har börjat ombenämna AI i officiella dokument till ”superintelligens” och enligt uppgift överväger att inrätta en särskild ”AI‑czar” för att styra USA:s politik. Talet berörde även andra utrikespolitiska prioriteringar – försvar av den pågående konflikten med Iran och tillkännagivande av ett nytt säkerhetsarrangemang med Danmark kring Grönland – vilket understryker hur AI vävs in i bredare geopolitiska narrativ. Vad som blir nästa att bevaka är huruvida administrationen formellt kommer att förankra sin ”superintelligens”-agenda genom lagstiftning eller verkställande order, samt hur den kommer att svara på det ökande trycket från allierade för ett gemensamt styrningsramverk. Observatörer kommer också att följa eventuella utnämningar av en senior AI‑tjänsteman, ett steg som antyddes i vår tidigare bevakning av en möjlig ”AI‑czar”. Den kommande UN‑sessionen och de planerade bilaterala samtalen om AI‑standarder kommer att pröva om Trumps avvisande av ett globalt program omvandlas till konkret politik eller förblir retorik.
25

Realtime‑Venus: Fullduplex‑interaktionssystem med asynkron delegation

HF Papers +5 källor hf papers
Ett forskarteam från Ant Group och Tsinghua University har presenterat **Realtime‑Venus**, en ny konversationsplattform som kan fortsätta samtala medan den arbetar i bakgrunden. Systemet kombinerar en inbyggd fullduplex‑modell med ett asynkront delegationsramverk, vilket gör att assistenten kan uppfatta, tala och överlämna uppgifter till externa verktyg utan att avbryta dialogen. Två specialiserade gränssnitt har släppts: **Realtime‑Venus‑Omni**, som hanterar ljud‑ och bildinteraktion, och **Realtime‑Venus‑Audio**, inriktat på talad kommunikation. Båda är byggda på MiniCPM‑o 4.5‑arkitekturen och delar ett efterträningsrecept som förenar offline‑förståelse med proaktiva fullduplex‑banor och delegationsarbetsflöden. Genombrottet är viktigt eftersom naturlig interaktion i både digitala och fysiska miljöer kräver kontinuerlig perception och snabba svar. Existerande röstassistenter väntar vanligtvis tills en användare är färdig med att tala innan de anropar externa tjänster, vilket skapar märkbar fördröjning. Genom att hålla förgrundsdialogen levande medan en bakgrunds‑“harnäs” utför kommandon, lovar Realtime‑Venus smidigare, mer mänskliga utbyten och kan påskynda antagandet av multimodala AI i robotik, smarta hem‑enheter och immersiva medier. Den öppna källkodsutgåvan på GitHub innehåller kod, snabbstartsinstruktioner och en referens, och inbjuder utvecklare att experimentera med det asynkrona delegationsmönstret. Håll utkik efter tidiga integrationer i konsumentprodukter, prestandajämförelser som mäter svarstid och uppgiftsslutförandegrad mot nuvarande assistenter, samt hur forskarsamhället bygger vidare på efterträningsreceptet. Systemet väcker också frågor om kontroll och säkerhet när AI‑agenter agerar autonomt i bakgrunden – frågor som sannolikt kommer att dyka upp när utvecklare börjar integrera Realtime‑Venus i verkliga tillämpningar.
18

Förbättrad promptcachning för GPT-6

OpenAI +1 källor openai
OpenAI har lanserat en rad förbättringar av promptcachningssystemet som ligger till grund för GPT‑6, och lovar snabbare svar samt lägre driftskostnader. Uppdateringen ökar cacheträffningsgraden, introducerar rikare diagnostik och lägger till explicita brytpunkter samt nya kontrollreglage som låter utvecklare finjustera när och hur cachade prompts återanvänds. Genom att återanvända mer av samma promptkontext över förfrågningar kan modellen hoppa över onödig bearbetning, vilket minskar latensen och de tokenbaserade avgifterna som kunder betalar för varje fråga. Förändringen är viktig eftersom promptcachning är en nyckelfaktor för att skala stora språkmodeller i produktion. Högre träffningsgrad leder direkt till billigare API‑användning för företag som förlitar sig på återkommande eller liknande prompts – en fördel som kan göra GPT‑6 mer konkurrenskraftig mot rivaler som xAI’s Grok 4.7, som nyligen framhöll sina egna effektivitetsvinster. För utvecklare ger den tillagda diagnostiken och brytpunkterna tydligare insikt i cachebeteendet, vilket hjälper dem att optimera promptdesign och felsöka prestandaflaskhalsar. Det som blir intressant att följa är hur de nya kontrollerna tas i bruk i verkliga arbetsbelastningar och om OpenAI kommer att publicera benchmarkdata som kvantifierar latens- och kostnadsreduktioner. Analytiker kommer också att hålla utkik efter eventuella följdeffekter på prissättningsnivåer eller på lanseringen av GPT‑6‑baserade produkter som presenterades tidigare i månaden. Som vi rapporterade den 23 september, betonade lanseringen av GPT‑6 Sol och Luna redan lägre kostnad och färre misstag; denna cachningsuppgradering fördjupar löftet genom att tackla effektiviteten på infrastrukturnivå.
18

Stanford R&DE använder AI för att byta studenters ras i reklam

HN +1 källor hn
Stanfords forsknings‑ och utvecklingsenhet har börjat använda artificiell intelligens för att ändra den registrerade rasen på sina studenter i reklamsyfte. Enligt det korta meddelandet byter systemet automatiskt ut rasidentifierare i studentdata innan informationen levereras till kommersiella partners som säljer campus‑inriktade annonser. Initiativet är betydelsefullt eftersom det suddar ut gränsen mellan akademiskt dataskydd och kommersiell exploatering. Genom att förändra demografiska attribut möjliggör universitetet för annonsörer att skräddarsy kampanjer på ett sätt som kan förstärka stereotyper eller missrepresentera studentkåren. Praktiken väcker också frågor om samtycke, datasekretess och efterlevnad av antidiskrimineringslagar som reglerar hur personlig information får användas i marknadsföring. Intressenter – inklusive studentgrupper, integritetsförespråkare och tillsynsmyndigheter – kommer sannolikt att granska huruvida den AI‑drivna processen respekterar institutionell etik och juridiska förpliktelser. Att hålla utkik efter: Stanford förväntas offentliggöra ett detaljerat policydokument som beskriver teknikens omfattning och skyddsåtgärder. Lagstiftare och utbildningsmyndigheter kan söka klarhet i huruvida metoden strider mot gällande dataskyddslagstiftning. Samtidigt kan andra universitet utsättas för press att avslöja hur de använder AI för att hantera studentdemografi i kommersiella syften, vilket potentiellt kan leda till bredare branschriktlinjer för etisk AI‑användning i högre utbildnings reklam.

Alla datum