社区
首页
集团介绍
社区
资讯
行情
学堂
TigerGPT
登录
注册
点赞
点赞
回复
评论
收藏
编组 21备份 2
分享
矩形
金刚狼割韭菜
02-01
对 奥特曼一般都能把怪兽揍的屁滚尿流
奥特曼率队“血战”DeepSeek,o3-mini急上线!免费体验
ChatGPT被挤爆。
奥特曼率队“血战”DeepSeek,o3-mini急上线!免费体验
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。
形状备份
点赞
举报
登录后可参与评论
评论
推荐
最新
暂无评论
热议股票
{"i18n":{"language":"zh_CN"},"data":{"magic":2,"id":398750752661928,"tweetId":"398750752661928","gmtCreate":1738373572968,"gmtModify":1738379941427,"author":{"id":3548847772856151,"idStr":"3548847772856151","authorId":3548847772856151,"authorIdStr":"3548847772856151","name":"金刚狼割韭菜","avatar":"https://static.tigerbbs.com/edca0b30b7e243758d1bac348f3e2817","vip":1,"userType":1,"introduction":"","boolIsFan":false,"boolIsHead":false,"crmLevel":1,"crmLevelSwitch":0,"individualDisplayBadges":[],"fanSize":3,"starInvestorFlag":false},"themes":[],"images":[],"coverImages":[],"html":"<html><head></head><body><p>对 奥特曼一般都能把怪兽揍的屁滚尿流</p></body></html>","htmlText":"<html><head></head><body><p>对 奥特曼一般都能把怪兽揍的屁滚尿流</p></body></html>","text":"对 奥特曼一般都能把怪兽揍的屁滚尿流","highlighted":1,"essential":1,"paper":1,"likeSize":0,"commentSize":0,"repostSize":0,"favoriteSize":0,"link":"https://laohu8.com/post/398750752661928","repostId":1101056901,"repostType":2,"repost":{"id":"1101056901","kind":"news","pubTimestamp":1738372069,"share":"https://www.laohu8.com/m/news/1101056901?lang=&edition=full","pubTime":"2025-02-01 09:07","market":"us","language":"zh","title":"奥特曼率队“血战”DeepSeek,o3-mini急上线!免费体验","url":"https://stock-news.laohu8.com/highlight/detail?id=1101056901","media":"新智元","summary":"ChatGPT被挤爆。","content":"<html><head></head><body><p> 眼看DeepSeek风头尽显,被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用,每百万输入和输出token价格更是疯狂跳水打骨折价!</p><p style=\"text-align: start;\"> o3-mini,真的来了。</p><p style=\"text-align: start;\"> 刚刚,OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/5d85b826e9b9f1c50b185150688e755a\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"332\"/></p><p style=\"text-align: start;\"> 诚如奥特曼所言,免费用户直接打开‘Reason’即可体验,Plus用户每天会有更多用量,具体来说:</p><p style=\"text-align: start;\"> - ChatGPT免费版:首次体验推理模型</p><p style=\"text-align: start;\"> - ChatGPT Plus和团队版:每天150次对话限制</p><p style=\"text-align: start;\"> - ChatGPT Pro:无限制访问</p><p style=\"text-align: start;\"> - ChatGPT Enterprise和ChatGPT Edu:将在一周内可用</p><p style=\"text-align: start;\"> - API:向3-5级开发者开放(初期暂不支持图像分析功能)</p><p style=\"text-align: start;\"> - 输入1.10美元/百万token、输出4.40美元/百万token</p><p style=\"text-align: start;\"> 感谢DeepSeek,o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%,比满血版o1便宜93%。(但仍是GPT-4o mini的7倍左右)</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/c2895439d1b8866e21da0038fd4b4afd\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"334\"/></p><p style=\"text-align: start;\"> 订阅用户已经在第一时间‘告别’了o1-mini,还没来得及说再见</p><p style=\"text-align: start;\"> OpenAI表示,o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。</p><p style=\"text-align: start;\"> 通过优化科学(Science)、技术(Technology)、工程(Engineering)和数学(Mathematics)领域的推理能力,同时保持较低的成本,让高质量AI技术变得更加平易近人。</p><p style=\"text-align: start;\"> 值得一提的是,在ChatGPT中,o3-mini采用的是‘中等推理强度’,在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/d6fffcb251446bc9af83a8ebb2d939a2\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"377\"/></p><p style=\"text-align: start;\"> 目前,由于太过火爆,ChatGPT的项目和自定义GPTs功能都已经被挤崩了。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/33d9fc42e6c8aabcd84dbc04acd4d123\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"345\"/></p><p style=\"text-align: start;\"> 集成搜索,两种版本可选</p><p style=\"text-align: start;\"> 去年12月,十二天直播最后一弹,o3系列首次亮相便惊艳了所有人。相较于上一代o1模型,o3在ARC-AGI等多项基准测试中刷新SOTA。</p><p style=\"text-align: start;\"> 与o1-mini一样,o3-mini是最具性价比的推理模型,可谓是突破性能边界的‘小巨人’。</p><p style=\"text-align: start;\"> 在STEM领域,尤其是科学、数学和编程等方面,o3-mini性能表现卓越超越o1,并继承了上一代低成本和低延迟的优点。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/0a774470fd1b3061e5b54e1b513311fb\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"499\"/></p><p style=\"text-align: start;\"> 对于开发者来说,o3-mini简直就是一份‘大礼包’,它首次在小型推理模型中支持:包括函数调用、结构化输出和开发者消息、流式传输功能。</p><p style=\"text-align: start;\"> 开发者可以根据需求选择低、中、高三种推理强度,让o3-mini在处理复杂问题时进行‘深度思考’,灵活平衡速度和准确性。</p><p style=\"text-align: start;\"> 遗憾地是,o3-mini暂不支持视觉功能。</p><p style=\"text-align: start;\"> 如前所述,从今天起,o3-mini将通过Chat Completions API,Assistants API和Batch API向3-5级指定开发者开放。</p><p style=\"text-align: start;\"> 同时,o3-mini还整合了搜索功能,能够提供带有相关网络来源链接最新响应。</p><p style=\"text-align: start;\"> 一起来看看这款‘小而美’的o3-mini有什么过人之处。</p><p style=\"text-align: start;\"> 快速、强大、专为STEM领域推理优化</p><p style=\"text-align: start;\"> 与其前身OpenAI o1类似,OpenAI o3-mini专门针对STEM推理进行了优化。</p><p style=\"text-align: start;\"> 采用了中等推理强度的o3-mini,在数学、编程和科学领域的表现与o1不相上下,且响应速度更快。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/f0baaf2add5780b634fc87cd9746eae3\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"164\"/></p><p style=\"text-align: start;\"> 报告地址:https://cdn.openai.com/o3-mini-system-card.pdf</p><p style=\"text-align: start;\"> 专家测试评估显示,o3-mini相比o1-mini能够生成更准确、更清晰的答案,推理能力更强。</p><p style=\"text-align: start;\"> 在测试中,o3-mini的响应结果获得了56%的偏好度,在处理复杂现实问题时的重大错误率更是降低了39%。</p><p style=\"text-align: start;\"> 在中等推理强度设置下,o3-mini在最具挑战性的推理和智能评估项目(包括AIME和GPQA)中,均达到了与o1相当的水平。</p><p style=\"text-align: start;\"> 数学竞赛(AIME 2024)</p><p style=\"text-align: start;\"> 在低推理强度下,o3-mini达到了与o1-mini相当的水平;在中等推理强度下,其表现可与o1媲美;而在高推理强度下,o3-mini的表现更是超越了o1-mini和o1。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/29051a93c44cfb4afc5b916099d3e527\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"483\"/></p><p style=\"text-align: start;\"> 博士级科学问题(GPQA Diamond)</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/f155826633b83db7524a18fd31136f9c\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"418\"/></p><p style=\"text-align: start;\"> 研究级数学(FrontierMath)</p><p style=\"text-align: start;\"> 在高推理强度模式下,o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时,高推理强度的o3-mini能够一次性解决超过32%的测试题目,其中包括28%以上的T3级问题。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/854259d77b23d108aeabd23314bae2be\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"171\"/></p><p style=\"text-align: start;\"> 编程竞赛(Codeforces)</p><p style=\"text-align: start;\"> 随着推理强度的提升,OpenAI o3-mini的Elo得分不断提高,各层级表现均优于o1-mini。在中等推理强度下,其表现已能与o1相媲美。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/eaac5fb7f89007beff0b0662b0185187\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"417\"/></p><p style=\"text-align: start;\"> 软件工程(SWE-bench Verified)</p><p style=\"text-align: start;\"> o3-mini在高推理强度模式下,使用开源Agentless框架能达到39%的成功率,使用内部工具框架则可达到61%的成功率。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/522e56cb834315a0a8ff1a61eca7da4f\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"559\"/></p><p style=\"text-align: start;\"> LiveBench编码</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/036af7bfca03083a39a6a462ea317f40\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"204\"/></p><p style=\"text-align: start;\"> 人类偏好评估</p><p style=\"text-align: start;\"> 外部专家评测结果显示,o3-mini较o1-mini表现出更强的推理能力,能够生成更准确、更清晰的答案,尤其是在STEM领域中。在对比测试中,o3-mini获得了56%的用户偏好度,且在处理复杂现实问题时的重大错误率降低了39%。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/1d9f300dbee0c1fa4ecd0098ee06c95e\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"624\"/></p><p style=\"text-align: start;\"> 在技术报告中,o3-mini编程性能超越了GPT-4o和o1-preview,与o1不相上下。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/9d5fe94ae0daab3acc4df5490e659227\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"187\"/></p><p style=\"text-align: start;\"> 模型的速度与性能</p><p style=\"text-align: start;\"> o3-mini在保持与o1相当智能水平的同时,实现了更快的运行速度和更高的计算效率。</p><p style=\"text-align: start;\"> 除前文提到的STEM评估外,在中等推理强度下,o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。</p><p style=\"text-align: start;\"> 对比测试(A/B Testing)结果显示,o3-mini的平均响应时间为7.7秒,较o1-mini的10.16秒提升了24%。</p><p style=\"text-align: start;\"> o1-mini和o3-mini(medium)的延迟对比</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/75f988a85d34378630474da91eef0dfb\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"462\"/></p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/e9608c4d8b28900767f12e8d4ba68db3\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"151\"/></p><p style=\"text-align: start;\"> 安全评估</p><p style=\"text-align: start;\"> OpenAI在训练o3-mini确保其安全响应,采用的关键技术之一是审慎对齐(deliberative alignment)。</p><p style=\"text-align: start;\"> 这项技术使模型能够在响应用户提示词前,对人工制定的安全规范进行全面推理。</p><p style=\"text-align: start;\"> 与o1相似,o3-mini在高难度安全性测试和越狱评估中,明显优于GPT-4o。</p><p style=\"text-align: start;\"> 在正式部署前,研究人员采用与o1相同的准备方法,结合外部红队测试和安全性评估,对o3-mini的安全风险进行了全面评估。</p><p style=\"text-align: start;\"> 禁止内容评估</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/11f65d312ff224af0da76315f2a81939\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"225\"/></p><p style=\"text-align: start;\"> 越狱评估</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/9a73a548a900a8919fe8671ffe7da647\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"194\"/></p><p style=\"text-align: start;\"> OpenAI急了</p><p style=\"text-align: start;\"> 去年年底放出o3和o3-mini的预览时,CEO奥特曼就曾表示,o3-mini将会在1月份发布。</p><p style=\"text-align: start;\"> 随后,奥特曼又在1月17日预告称,o3-mini会在几周内发布。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/e8c8121bd5d45e153fb146efaa41369a\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"312\"/></p><p style=\"text-align: start;\"> 现在,o3-mini果然如约而至(卡在ddl最后一天),但外面的世界已经是天差地别。</p><p style=\"text-align: start;\"> 面对正在快速崛起的DeepSeek-R1,o3-mini存在着一个关键问题——‘不开源’。</p><p style=\"text-align: start;\"> 这也就意味着,它无法离线使用、无法下载代码,也无法以相同的程度进行自定义。对于很多应用过来说,它的吸引力相对于R1明显大打折扣。</p><p style=\"text-align: start;\"> 在上下文窗口方面,DeepSeek-R1约为128K/130K token,而o3-mini略胜一筹达到了200K token。其中,每个输出最多100K token,跟满血版o1相同。</p><p style=\"text-align: start;\"> 在价格方面,相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1,o3-mini依然贵出了天际。</p><p style=\"text-align: start;\"> 但作为一款美国模型,o3-mini在身份上无疑占尽了好处:应该会是欧美很多企业的首选。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/3a93fb5ad2854365a650dbf713ccc8f1\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"336\"/></p><p style=\"text-align: start;\"> 奥特曼亲自率队</p><p style=\"text-align: start;\"> 这一次,最强最新的o3-mini模型训练,奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/08d8c60f7b55269094f03e254ae54504\" alt=\"\" title=\"\" tg-width=\"550\" tg-height=\"1110\"/></p><p style=\"text-align: start;\"> 接下来,如果说OpenAI还藏在什么杀手锏,那就是满血版的o3了。根据12月时的说法,它将在‘此后不久’发布。</p></body></html>","source":"lsy1569730104218","collect":0,"html":"<!DOCTYPE html>\n<html>\n<head>\n<meta http-equiv=\"Content-Type\" content=\"text/html; charset=utf-8\" />\n<meta name=\"viewport\" content=\"width=device-width,initial-scale=1.0,minimum-scale=1.0,maximum-scale=1.0,user-scalable=no\"/>\n<meta name=\"format-detection\" content=\"telephone=no,email=no,address=no\" />\n<title>奥特曼率队“血战”DeepSeek,o3-mini急上线!免费体验</title>\n<style type=\"text/css\">\na,abbr,acronym,address,applet,article,aside,audio,b,big,blockquote,body,canvas,caption,center,cite,code,dd,del,details,dfn,div,dl,dt,\nem,embed,fieldset,figcaption,figure,footer,form,h1,h2,h3,h4,h5,h6,header,hgroup,html,i,iframe,img,ins,kbd,label,legend,li,mark,menu,nav,\nobject,ol,output,p,pre,q,ruby,s,samp,section,small,span,strike,strong,sub,summary,sup,table,tbody,td,tfoot,th,thead,time,tr,tt,u,ul,var,video{ font:inherit;margin:0;padding:0;vertical-align:baseline;border:0 }\nbody{ font-size:16px; line-height:1.5; color:#999; background:transparent; }\n.wrapper{ overflow:hidden;word-break:break-all;padding:10px; }\nh1,h2{ font-weight:normal; line-height:1.35; margin-bottom:.6em; }\nh3,h4,h5,h6{ line-height:1.35; margin-bottom:1em; }\nh1{ font-size:24px; }\nh2{ font-size:20px; }\nh3{ font-size:18px; }\nh4{ font-size:16px; }\nh5{ font-size:14px; }\nh6{ font-size:12px; }\np,ul,ol,blockquote,dl,table{ margin:1.2em 0; }\nul,ol{ margin-left:2em; }\nul{ list-style:disc; }\nol{ list-style:decimal; }\nli,li p{ margin:10px 0;}\nimg{ max-width:100%;display:block;margin:0 auto 1em; }\nblockquote{ color:#B5B2B1; border-left:3px solid #aaa; padding:1em; }\nstrong,b{font-weight:bold;}\nem,i{font-style:italic;}\ntable{ width:100%;border-collapse:collapse;border-spacing:1px;margin:1em 0;font-size:.9em; }\nth,td{ padding:5px;text-align:left;border:1px solid #aaa; }\nth{ font-weight:bold;background:#5d5d5d; }\n.symbol-link{font-weight:bold;}\n/* header{ border-bottom:1px solid #494756; } */\n.title{ margin:0 0 8px;line-height:1.3;color:#ddd; }\n.meta {color:#5e5c6d;font-size:13px;margin:0 0 .5em; }\na{text-decoration:none; color:#2a4b87;}\n.meta .head { display: inline-block; overflow: hidden}\n.head .h-thumb { width: 30px; height: 30px; margin: 0; padding: 0; border-radius: 50%; float: left;}\n.head .h-content { margin: 0; padding: 0 0 0 9px; float: left;}\n.head .h-name {font-size: 13px; color: #eee; margin: 0;}\n.head .h-time {font-size: 11px; color: #7E829C; margin: 0;line-height: 11px;}\n.small {font-size: 12.5px; display: inline-block; transform: scale(0.9); -webkit-transform: scale(0.9); transform-origin: left; -webkit-transform-origin: left;}\n.smaller {font-size: 12.5px; display: inline-block; transform: scale(0.8); -webkit-transform: scale(0.8); transform-origin: left; -webkit-transform-origin: left;}\n.bt-text {font-size: 12px;margin: 1.5em 0 0 0}\n.bt-text p {margin: 0}\n</style>\n</head>\n<body>\n<div class=\"wrapper\">\n<header>\n<h2 class=\"title\">\n奥特曼率队“血战”DeepSeek,o3-mini急上线!免费体验\n</h2>\n\n<h4 class=\"meta\">\n\n\n2025-02-01 09:07 北京时间 <a href=https://finance.sina.com.cn/tech/internet/2025-02-01/doc-inehxnsk0840776.shtml><strong>新智元</strong></a>\n\n\n</h4>\n\n</header>\n<article>\n<div>\n<p>眼看DeepSeek风头尽显,被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用,每百万输入和输出token价格更是疯狂跳水打骨折价! o3-mini,真的来了。 刚刚,OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。 诚如奥特曼所言,免费用户直接打开‘Reason’即可体验,Plus用户每天会有更多用量,具体来说: - ...</p>\n\n<a href=\"https://finance.sina.com.cn/tech/internet/2025-02-01/doc-inehxnsk0840776.shtml\">Web Link</a>\n\n</div>\n\n\n</article>\n</div>\n</body>\n</html>\n","type":0,"thumbnail":"https://static.tigerbbs.com/1f94b93604bfb69924bf114f33b52cfb","relate_stocks":{},"source_url":"https://finance.sina.com.cn/tech/internet/2025-02-01/doc-inehxnsk0840776.shtml","is_english":false,"share_image_url":"https://static.laohu8.com/e9f99090a1c2ed51c021029395664489","article_id":"1101056901","content_text":"眼看DeepSeek风头尽显,被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用,每百万输入和输出token价格更是疯狂跳水打骨折价! o3-mini,真的来了。 刚刚,OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。 诚如奥特曼所言,免费用户直接打开‘Reason’即可体验,Plus用户每天会有更多用量,具体来说: - ChatGPT免费版:首次体验推理模型 - ChatGPT Plus和团队版:每天150次对话限制 - ChatGPT Pro:无限制访问 - ChatGPT Enterprise和ChatGPT Edu:将在一周内可用 - API:向3-5级开发者开放(初期暂不支持图像分析功能) - 输入1.10美元/百万token、输出4.40美元/百万token 感谢DeepSeek,o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%,比满血版o1便宜93%。(但仍是GPT-4o mini的7倍左右) 订阅用户已经在第一时间‘告别’了o1-mini,还没来得及说再见 OpenAI表示,o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。 通过优化科学(Science)、技术(Technology)、工程(Engineering)和数学(Mathematics)领域的推理能力,同时保持较低的成本,让高质量AI技术变得更加平易近人。 值得一提的是,在ChatGPT中,o3-mini采用的是‘中等推理强度’,在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。 目前,由于太过火爆,ChatGPT的项目和自定义GPTs功能都已经被挤崩了。 集成搜索,两种版本可选 去年12月,十二天直播最后一弹,o3系列首次亮相便惊艳了所有人。相较于上一代o1模型,o3在ARC-AGI等多项基准测试中刷新SOTA。 与o1-mini一样,o3-mini是最具性价比的推理模型,可谓是突破性能边界的‘小巨人’。 在STEM领域,尤其是科学、数学和编程等方面,o3-mini性能表现卓越超越o1,并继承了上一代低成本和低延迟的优点。 对于开发者来说,o3-mini简直就是一份‘大礼包’,它首次在小型推理模型中支持:包括函数调用、结构化输出和开发者消息、流式传输功能。 开发者可以根据需求选择低、中、高三种推理强度,让o3-mini在处理复杂问题时进行‘深度思考’,灵活平衡速度和准确性。 遗憾地是,o3-mini暂不支持视觉功能。 如前所述,从今天起,o3-mini将通过Chat Completions API,Assistants API和Batch API向3-5级指定开发者开放。 同时,o3-mini还整合了搜索功能,能够提供带有相关网络来源链接最新响应。 一起来看看这款‘小而美’的o3-mini有什么过人之处。 快速、强大、专为STEM领域推理优化 与其前身OpenAI o1类似,OpenAI o3-mini专门针对STEM推理进行了优化。 采用了中等推理强度的o3-mini,在数学、编程和科学领域的表现与o1不相上下,且响应速度更快。 报告地址:https://cdn.openai.com/o3-mini-system-card.pdf 专家测试评估显示,o3-mini相比o1-mini能够生成更准确、更清晰的答案,推理能力更强。 在测试中,o3-mini的响应结果获得了56%的偏好度,在处理复杂现实问题时的重大错误率更是降低了39%。 在中等推理强度设置下,o3-mini在最具挑战性的推理和智能评估项目(包括AIME和GPQA)中,均达到了与o1相当的水平。 数学竞赛(AIME 2024) 在低推理强度下,o3-mini达到了与o1-mini相当的水平;在中等推理强度下,其表现可与o1媲美;而在高推理强度下,o3-mini的表现更是超越了o1-mini和o1。 博士级科学问题(GPQA Diamond) 研究级数学(FrontierMath) 在高推理强度模式下,o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时,高推理强度的o3-mini能够一次性解决超过32%的测试题目,其中包括28%以上的T3级问题。 编程竞赛(Codeforces) 随着推理强度的提升,OpenAI o3-mini的Elo得分不断提高,各层级表现均优于o1-mini。在中等推理强度下,其表现已能与o1相媲美。 软件工程(SWE-bench Verified) o3-mini在高推理强度模式下,使用开源Agentless框架能达到39%的成功率,使用内部工具框架则可达到61%的成功率。 LiveBench编码 人类偏好评估 外部专家评测结果显示,o3-mini较o1-mini表现出更强的推理能力,能够生成更准确、更清晰的答案,尤其是在STEM领域中。在对比测试中,o3-mini获得了56%的用户偏好度,且在处理复杂现实问题时的重大错误率降低了39%。 在技术报告中,o3-mini编程性能超越了GPT-4o和o1-preview,与o1不相上下。 模型的速度与性能 o3-mini在保持与o1相当智能水平的同时,实现了更快的运行速度和更高的计算效率。 除前文提到的STEM评估外,在中等推理强度下,o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。 对比测试(A/B Testing)结果显示,o3-mini的平均响应时间为7.7秒,较o1-mini的10.16秒提升了24%。 o1-mini和o3-mini(medium)的延迟对比 安全评估 OpenAI在训练o3-mini确保其安全响应,采用的关键技术之一是审慎对齐(deliberative alignment)。 这项技术使模型能够在响应用户提示词前,对人工制定的安全规范进行全面推理。 与o1相似,o3-mini在高难度安全性测试和越狱评估中,明显优于GPT-4o。 在正式部署前,研究人员采用与o1相同的准备方法,结合外部红队测试和安全性评估,对o3-mini的安全风险进行了全面评估。 禁止内容评估 越狱评估 OpenAI急了 去年年底放出o3和o3-mini的预览时,CEO奥特曼就曾表示,o3-mini将会在1月份发布。 随后,奥特曼又在1月17日预告称,o3-mini会在几周内发布。 现在,o3-mini果然如约而至(卡在ddl最后一天),但外面的世界已经是天差地别。 面对正在快速崛起的DeepSeek-R1,o3-mini存在着一个关键问题——‘不开源’。 这也就意味着,它无法离线使用、无法下载代码,也无法以相同的程度进行自定义。对于很多应用过来说,它的吸引力相对于R1明显大打折扣。 在上下文窗口方面,DeepSeek-R1约为128K/130K token,而o3-mini略胜一筹达到了200K token。其中,每个输出最多100K token,跟满血版o1相同。 在价格方面,相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1,o3-mini依然贵出了天际。 但作为一款美国模型,o3-mini在身份上无疑占尽了好处:应该会是欧美很多企业的首选。 奥特曼亲自率队 这一次,最强最新的o3-mini模型训练,奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。 接下来,如果说OpenAI还藏在什么杀手锏,那就是满血版的o3了。根据12月时的说法,它将在‘此后不久’发布。","news_type":1},"isVote":1,"tweetType":1,"viewCount":792,"commentLimit":10,"likeStatus":false,"favoriteStatus":false,"reportStatus":false,"symbols":[],"verified":2,"subType":0,"readableState":1,"langContent":"CN","currentLanguage":"CN","warmUpFlag":false,"orderFlag":false,"shareable":true,"causeOfNotShareable":"","featuresForAnalytics":[],"commentAndTweetFlag":false,"andRepostAutoSelectedFlag":false,"upFlag":false,"length":34,"optionInvolvedFlag":false,"xxTargetLangEnum":"ZH_CN"},"commentList":[],"hasMoreComment":false,"orderType":2}