首页时事民生政务教育文化科技财富体娱健康情感

旅行百科职场楼市企业乐活学术汽车时尚创业美食幽默美体文摘

Kimi版o1实装上线，这里是我们的一手测试↑

科技 2024-12-16 21:02 北京

明月发自凹非寺
量子位 | 公众号 QbitAI

Kimi新模型来袭，且发布即上线可用！

就在数学模型k0-math刚发布后没几天，视觉思考模型k1就来了，多项思考推理测试超越Open AI o1。

官方表示，基于强化学习，k1原生支持端到端图像理解和思维链技术。

换句话说，k1能够深入图片信息抽丝剥茧，层层推理，由此解锁了包括几何图形题在内更加全面的数学能力。

模型思索答案的全过程，belike：

并且k1的思考能力不仅仅局限于数学领域，正所谓“学好数理化，走遍天下都不怕”。

在官方晒出的数理化基准测试中，Kimi k1-preview表现全面超越OpenAI o1、GPT-4o、Claude 3.5 Sonnect。

这次Kimi新模型的发布还是直接上线可玩的那种，APP或是网页版找到“Kimi视觉思考版”即可上传图片点击使用。

话不多说，这就赶紧来实测一波～

数理化第一波实测

先来一道考研数学真题小试牛刀，这道题目涉及的知识点包括曲面积分、高斯定理等：

之前在量子位的实测中，这道题难住了GPT-4o。

而Kimi视觉思考版经过一步步详细推理，第一次就给出了正确答案。

它自己也表示进行了检查没有错误，“对这个答案非常有信心”。

再来一道曾经测试过o1的数学概论题。

一个外星人来到地球后，第1天有相等的可能选择以下四件事中的一件完成：
自我毁灭；分裂成两个外星人；分裂成三个外星人；什么都不做。
此后每天，每个外星人均会做1次选择，且彼此之间相互独立，求地球上最终没有外星人的概率。

Kimi视觉思考版也一次就做对了：

数学能力看完后，再来小试一下物理题。

下面这道题是大学物理中的光学题：

在双缝干涉实验中，波长λ=550nm的单色平行光垂直入射到缝间距a=2×10⁻⁴m的双缝上，屏到双缝的距离D=2m。求中央明纹两侧的两条第10级明纹中心的间距。

Kimi视觉思考版成功回答对。

而且其实它早早就给出了正确答案，但还是严谨地用不同的方法反复验证确认后给出答案。

最后再来一道“化学题”（doge）：

Candy, Happy, Bacon, Scary, Brain, House
Which is the odd one?
Hint: Chemistry

Kimi视觉思考版在推理过程中几经曲折，但最后答案还是正确的（happy）。

除了发布新模型，k1背后的的技术大方向也被月之暗面公开了。

基于强化学习的新一代推理模型

据介绍，k1是他们基于强化学习技术的新一代模型，称为思考模型，真正意义上实现了端到端的图像理解和思考能力。

从模型训练上来看，分为两个阶段：先通过预训练得到基础模型，再在基础模型上进行强化学习后训练。

最为关键的是，k1遵循强化学习Scaling Law，在强化学习后训练在数据质量和学习效率方面做了进一步优化。

传统基于文本的推理模型，或者不支持图像信息输入，或者需要借助外部OCR/视觉模型进行转换，效果有明显损失。

而Kimi视觉思考版由于是原生的端到端视觉推理模型，视觉+推理，可直接理解图片信息并进行深度推理。

在“噪声”场景，即拍摄图片模糊、手写字迹潦草等情况下，性能损失幅度也较小。

既然如此，把思路打开，除了让它做数理化推理题，或许还可以拿一堆图让它帮忙推理出任何我想知道的内容。

比如把朋友的“歌单”截图发给它，让它给我分析一下这位朋友的MBTI。

你还别说，k1的推理有理有据，先理解MBTI是什么，然后像侦探似的仔细分析图片中的曲目并进行分类，接着寻找这些歌手、风格之间的相似之处。

它甚至还会“平衡矛盾特征”，即使给出了猜测还会多加一步“验证”。

最终才会给出一个比较合理的猜测。

再比如，或者还可以拿出这么一份字迹潦草模糊的手写稿，让它帮我推理出这是谁写的、笔记内容在讲什么。

思路再次被打开。

最后不得不说的是，最近这几天国内外大模型新进展真不少，前有谷歌，现在还有Kimi，OpenAI“圣诞节直播12天”可谓是被一而再再而三的“狙击”了。

你觉得Kimi新模型的表现如何？感兴趣的童鞋不妨亲自上手考考它～

— 完 —

点这里👇关注我，记得标星哦～

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~

追踪人工智能新趋势，关注科技行业新突破

最新文章

Ilya宣判后GPT-5被曝屡训屡败，一次训数月，数据要人工从头构建

素数分布规律又有新发现！赵宇飞学生与牛津教授合作成果

o3来了！编程跻身人类全球前200，破解陶哲轩说难的数学测试，北大校友任泓宇现身直播间

图森未来转型6个月：推出AI大模型，布局游戏生态，思考和底气是什么？

这届AI创业：不敲一行代码，营收突破百万级

AI已经在直播间狂刷KPI了

AI风暴席卷达摩院青橙奖，六成获奖者用AI搞科研，平均年龄34岁

1万人研究证实：玩游戏提升智力，与遗传/经济水平都无关

AI能传递气味了！能定制个性化气味，谷歌前研究员新技术

突发！GPT论文一作Alec Radford离职，前两代GPT作者全部离开OpenAI

不会代码的独立开发者，除了学Cursor，还该会些什么？｜十问爆款「小猫补光灯」

谷歌版o1突发即屠榜！思考速度比所有模型快5倍，能解摩斯代码，数学物理秒秒钟解决

苹果Mac用户狂喜！ChatGPT深度集成应用，最后再藏AGI彩蛋

豆包升级了“眼睛”，看APP截图就能写代码了！超低价让多模态AI普惠

100+大模型综测结果出炉！智源发布FlagEval“百模”评测结果，覆盖文本语音图片视频多种模态

12个大模型攒局玩“大富翁”：Claude3.5爱合作，GPT-4o最“自私”｜谷歌DeepMind研究

Claude团队揭发AI伪装对齐：训练时假装遵守目标，只为保护自己价值观不被修改

腾讯版Sora开源后，被提速8倍！官方点赞并预告：下月上新图生视频

突破自动驾驶视频生成极限：港中文&港科大&华为联手推出MagicDriveDiT

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

云计算一哥的生成式AI之道：Choice Matters

大模型是新的数据库！蚂蚁开源负责人王旭：应用开发新范式，新一代LAMP正在形成 | MEET 2025

英伟达新品“掌心AI超算”，¥1800跑8B多模态模型，算力暴增70%价格腰斩

GPT-4o数学能力跑分直掉50%，上海AI Lab开始给大模型重新出题了

更懂中文还兼顾SD生态，360开源文生图模型结构，寡姐秒变中国新娘 | AAAI

我们要做3D界的ImageNet，推动具身智能训练新范式｜群核科技唐睿@MEET2025

见证历史！AI想的科研idea，真被人类写成论文发表了

从骁龙8至尊版，我看到了AI手机的未来 | 智在终端

新奥程路：AI×能源已到“奇点变革”前夜，仿真大模型是关键｜MEET 2025

开源Llama版o1来了，3B小模型反超80B，逆向工程复现OpenAI新Scaling Law

宇树机器人强化学习代码全面开源，还有训练到仿真和实操手把手教学

为多模态LLM引入ControlNet理念，开源插件解决灾难性遗忘 | AAAI

刚刚，智谱又融了30亿！超200亿估值引领大模型创业赛道

谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

ChatGPT搜索与Her打通了！搜索免费开放，居然还剧透明日直播主题

Kimi版o1实装上线，这里是我们的一手测试↑

把1个脑洞发展成1场顶会workshop，阿里妈妈只用了1年｜直击NeurIPS'24

企业级Agent已进入生产力阶段｜BetterYeah AI张毅@MEET

Gemini 2.0成P图神器，各种P图只需一句话的事儿，可把网友馋哭了

21天不用手机，抑郁减少，入睡更快丨正经研究

基于昇腾算力突破AI求解，最高加速100倍！| 华为GTS&深圳市大数据研究院

全球首个全模态理解开源端模型：长语音自动总结，图文音啥都会！300%推理速度领先，来自无问芯穹

月薪1万4的ChatGPT要来了！OpenAI自曝其达博士级别，网友：我宁可聘请一个博士

直击CCAI大会：院士专家舌战激辩，20个AI案例C位出道，海淀无愧AI科技“梦工厂”

OpenAI附议Ilya预训练终结！“但Scaling Law还没死”

Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

Ilya宣判：预训练即将终结！NeurIPS现场沸腾

ChatGPT终于也推出Projects功能，却故意露出一个“AGI”的项目

4000万+用户！测测CEO任永亮：一个行业既不能离AI太近也不能离AI太远 | MEET 2025

专治大模型“套壳”！上海AI实验室等给LLM做“指纹识别”，剪枝合并也无所遁形

分类

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉