Introducing LifeSciBench
Introducing LifeSciBench, an expert-authored, expert-reviewed benchmark for evaluating how AI systems handle real-world life science research tasks and decisions.
Introducing LifeSciBench, an expert-authored, expert-reviewed benchmark for evaluating how AI systems handle real-world life science research tasks and decisions.
OpenAI 推出 LifeSciBench,这是一个由专家撰写和评审的基准测试,用于评估 AI 系统处理真实世界生命科学研究任务的能力,涵盖 750 个任务和多个生物领域。
最新研究表明,AI 在文本说服力上已超过人类专家,甚至在真实募捐场景中表现更佳,这可能导致权力重新集中,也可能为弱势群体提供新工具。
A new OpenAI research paper shows how AI agents are transforming work, enabling longer, more complex tasks and expanding productivity across roles.
Taste,决定天花板。
OpenSquilla 上线后数周内 GitHub star 增至数千量级
共同推进物理AI前沿技术探索。
重写“AI如何反复推演世界”
四大互联网分别领投