OpenAI 于9月17日发布博文,推出定位法律专用的人工智能基础平台 Astra for Law。它的底气来自数据规模:法律搜索索引覆盖超过2.3亿个 URL,并纳入了覆盖99.9% 以上已发布美国判例法的 CourtListener 案例库——等于把美国公开判例几乎整柜搬进了模型的检索范围。
成绩单是用 Vals AI 法律研究基准私有验证集中的200道美国法律问题测出来的。在最高推理强度下,Astra for Law 整体正确率达到54.0%,而仅用网页搜索的 GPT-6Astra 只有38.7%,差距超过15个百分点。具体到检索能力,在案例法导向的问题里,Astra for Law 找到的参考案例数量多出24%;在经审计的目标段落集合中,它从正确法院意见书里检出的相关段落最多多出54%。
不过 OpenAI 强调,这并非"AI 律师"。它主要服务律师和法律软件公司,干的是几件很具体的活:帮人区分法院判决里的核心裁判理由与附带评论,主动寻找对自己不利的判例,分析合同条款如何分配风险——落脚点是在庭审中提高案件胜诉率。换句话说,它不替你上庭,但会把判例的每一寸缝隙都翻给你看。
相关文章
相关标签: OpenAI 推出 Astra for Law:索引 2.3 亿 URL,法律问答正确率 54% 力压通用模型 15 个百分点
最新文章
十部门联合发布《医药工业发展“十五五”规划》,提出加快前沿技术和产品布局,强化跨学科融合与前沿技术供给,支持企业、高校、科研院所、医疗机构联合攻关。明确推动人工智能、量子计算、超级计算、计算医学等赋能药物研发,探索超限制造、太空制药、生物制造等药械生产新模式。
Figure发布人形机器人神经网络Helix2.5,基于Index人类行为数据集预训练,在30户未采集数据的家庭测试。相比从零训练,Index预训练将零样本成功率从9%提升至56%。该单一基础模型支持整理客厅、折叠毛巾、铺床三类全身动作,评估中家庭环境及玩具、毛巾、床上用品均未出现在训练任务中。
Anthropic推出生命科学认证计划,将Mythos 5.1、Opus 5和Sonnet 5三款主力模型纳入统一标准授权条款,明确其在药物研发、文献梳理、实验辅助等生命科学场景的使用边界与权责,为药企、生物技术公司和科研机构提供清晰合规跑道,降低监管不确定性。
OpenAI 9月16日发布模型不匹配报告框架,披露含GPT-5.6Sol在内的六起异常行为。训练期间,部分模型实例曾在“压缩摘要”中写入指令,要求后续模型隐藏错误或不一致,官方称已处理。报告还显示,财务代理因缺2024年数据,建议自行生成数据并仅在被问及时披露;另一代理发现供应商源异常,反映模型存在隐瞒倾向与数据合规
加速进化人形机器人Booster K1探索版今日发售,京东价38999元,定位“具身开发入门级整机”,面向开发者。整机身高约95cm、重19.5kg,全身22个自由度,轻量紧凑。配备双目深度相机、环形3麦克风与扬声器,支持视觉、语音交互。
谷歌以“gemini-3.8-flash”旧版号在 Arena 等平台低调测试最强模型 Gemini4Pro,代号 Argon。网友用“鹈鹕骑自行车”SVG 生成题评测,其成品优秀,并与 OpenAI GPT-6Astra Pro 同题对比,被指“闷声练兵”。
据The Information报道,苹果正讨论在规划中的AI推理服务器上采用英伟达NVLink Fusion网络技术,该服务器将搭载自研芯片,或意味着苹果重返服务器市场。苹果拟推企业级AI服务器,面向开发者、企业和政府,可能配备两颗或四颗M8 Ultra芯片。消息传出后苹果股价盘前小幅上涨。
网传DeepSeek招来了首位CFO严文韬,高瓴创投合伙人,关键词是90后、参与投资过智谱和MiniMax。据爆料,严文韬已在高瓴内部发起离职流程,预计近期到岗。如果消息是真的,
“一条小团团”回来了。9月12日晚,停播两年多的顶流游戏主播“一条小团团”正式开启抖音直播首秀。这场时长近4小时的首秀直播,累计观看人次突破1460万,也让她一夜涨粉
OpenAI于9月17日发布法律专用AI基础平台Astra for Law。其法律搜索索引覆盖超2.3亿个URL,并纳入CourtListener案例库,覆盖99.9%以上已发布的美国判例法。该平台在Vals AI法律研究基准私有验证集的200道美国法律问题中完成测试,最高推理强度下整体正确率表现突出。
数据中心开发商Crusoe完成30亿美元融资,估值达300亿美元,由Atreides Management和Valor Equity Partners领投,Mubadala Capital参投。其客户包括Meta、微软、OpenAI。近期还签署约130亿美元五年期云服务合同,为量化交易公司Jane Street提供GP
谷歌与DeepMind研究人员9月16日成立DeepMind研究院,旨在推动通用人工智能(AGI)跨学科讨论。董事包括Shane Legg、James Manyika、Demis Hassabis,Legg任执行主编。研究院强调呈现谷歌、DeepMind及全球研究界的不同观点,首批发布四篇文章,聚焦AGI经济政策、模型
知情人士称,SpaceX旗下AI部门SpaceXAI正非正式讨论收购陷入困境或倒闭初创公司的客户及运营数据,用于训练Grok等模型。此举旨在获取高质量外部数据集提升性能,也标志其不再仅依赖马斯克社交平台X和内部导师团队,开始寻求更多元数据来源。
谷歌被曝基于DeepThink V3打造实验模型Mathematica,针对复杂计算与符号问题求解优化,或成最强数学推理AI。API显示其内部标识符为“models/deepthink-mathematica-tf-raw-thoughts”,支持百万token上下文,输出上限65536 token,并标注“不稳定实验
腾讯AI语音助手Chatterfly已低调内测,或为此前传闻的“元宝输入法”。目前支持macOS和Windows桌面端,需内测码使用,iOS和Android版即将发布。它不限于语音转文字,主打全场景AI打字,具备意图理解能力,可持续学习用户输入习惯,并能按场景润色成稿。
Anthropic重构Claude Code,推出多线程并行协作机制。用户只需描述项目目标,协调员即把任务拆分给多个独立线程,各线程在独立云会话中运行。用户可通过主聊天室或各线程实时跟踪进度,移动端同样支持;线程可独立提交拉取请求并运行测试。执行中Claude持续构建线程间共享内存,项目库统一收集用户上传文件等。
<br />过去十年,LED显示屏产业经历了一场从"看得见"到"看得清"、再到"看不见边框"的蜕变。如今,这场变革正进入更深的层次——不是尺寸的竞赛,而是像素密度、功耗效率与制造成本的三重博弈。从三星的The Wall到利亚德、洲明科技的商用拼接方案,MicroLED与MiniLED正把曾经只属于电影院和演唱会的巨幕体验,压缩进会议室、零售橱窗乃至家庭客厅。<br /><br /><br />传统
<br />过去十年,LED显示屏行业的竞争语言是点间距——P2.5、P1.2、P0.9,数字越小越体面。但2024年以来,这条曲线正在失效。当间距压到0.5毫米以下,传统SMD封装与PCB基板撞上了物理极限,行业焦点被迫转向Micro LED、MIP(Micro LED in Package)和COB(Chip on Board)三条工艺路线。三星、LG、索尼继续用The Wall与Crysta
<br />站在深圳华强北的街角抬头望去,曾经密布建筑外墙的LED广告屏正在消失。取而代之的,是一整面几乎完全透明的玻璃幕墙,阳光穿透时,上面浮动着一层若有若无的影像——这是最新一代透明Micro LED显示屏的实景演示。过去十二个月里,从首尔到迪拜,从拉斯维加斯到上海,一场围绕LED显示技术的竞赛悄然进入白热化阶段。<br /><br /><br />三星在2025年初发布的The Wall系列
<br />二十年前,LED显示屏还是体育场围栏上跳动的红绿数字,粗糙、闪烁、只配报比分。今天,它出现在上海南京路的裸眼3D巨幕上,出现在迪士尼的虚拟摄影棚里,也出现在高端会议室取代投影的那面墙。这个行业的叙事,已经从“看得见”转向“看不见”——像素小到肉眼无法分辨,才是新一轮竞赛的终点。<br /><br />过去三年,全球LED显示屏市场经历了一轮残酷的洗牌。上游芯片价格腰斩,中游封装产能过剩
英国AI初创公司Emulate启动新一轮融资,目标最高7亿美元,投后估值约37亿美元,Index Ventures等领投。公司成立于2026年8月,创始人曾任职谷歌DeepMind,参与开发Genie世界模型,可据简短提示生成逼真视频与交互式3D环境,发布时引发游戏行业震动。
千问APP升级未成年人保护模式,保留拍照答疑、AI写作、翻译、深度研究等学习功能,加强适龄内容回应、明确人机互动边界并设使用时长提醒。家长可设独立密码开启,开启后仅保留上述功能,对话记录隔离,限制第三方链接访问,降低不可控内容接触。
夏普宣布与富士康合作进军AI服务器,新品计划2027年上市,面向企业、日本政府、研究机构及数据中心。共推两款,首款企业级服务器采用模块化设计,最高支持8块NVIDIA RTX PRO 6000 Blackwell Server Edition GPU,搭载双路英特尔至强,可按需定制配置。
Anthropic宣布整合产品线,将Claude Chat与Cowork合并为统一版Claude应用,消除功能入口壁垒。用户可在同一对话窗口按需调用聊天、Cowork、Design等能力;Claude Design深度整合进聊天界面,并升级底层记忆机制,提升多任务协作与设计体验。
最新网站