195UCLA Finds AI Reward Hack Monitors Collapse to 28% on Real CheatingArena.ai·Post Training·1 day ago·
484Ant Group's Ling 3.0 Flash Beats a 1T Model With 5B Active ParametersArtificial Analysis·Llms·2 days ago·
5,830Anthropic's Managed Agents Gets Budget Caps, Geo-Pinning and Smarter Advisor ModelsClaudeDevs·Agents·2 days ago·
62,521Anthropic's Claude Code Lets AI Sessions Talk Directly Without Human MiddlemenClaudeDevs·Development·2 days ago·
9,895OpenAI's Astra Becomes First AI Flagged as Critically Dangerous Before ReleaseOpenAI·Security·2 days ago·
17,604Anthropic's Claude Code Auto Mode Catches Dangerous Commands 89% of the TimeClaudeDevs·Development·2 days ago·
1,413Prime Intellect Ships Multi-Agent RL Training Into Its Open-Source StackPrime Intellect·Agents·2 days ago·
282Artificial Analysis Rebuilds Its Image Arena to Rank Models by Real WorkArtificial Analysis·Benchmarks·2 days ago·
1,741MiniMax Rebuilds Code 2.0 on Pi Agent, Slashing Latency by 90%MiniMax_Agent·Development·2 days ago·