大模型

图数据库的剪枝在大型语言模型中的知识表示

译者 | 李睿审校 | 重楼图数据库的剪枝通过删除不必要的信息并加以改进，可以使LLM更快、更高效，同时节省电力和资源。大型语言模型（LLM）通过从庞大的数据集中学习复杂的语言模式，极大地推进了自然语言处理（NLP）的发展。然而，当这些模型与结构化知识图谱（用于表示实体之间关系的数据库）结合在一起时，可能面临一些挑战。

1/15/2025 7:52:53 AM

李睿

2025，大厂们的「大模型牌桌」战

随着大模型六小虎在AGI上的后撤第一枪被正式打响，中国大模型行业的分水岭快速露出水面、更加清晰。初创公司在下一代超大规模模型竞争中的局限性开始被广泛关注，大厂「不下桌」的资本筹码变得更加明显。无论是百度宣布2025年将推出下一代基座模型，还是阿里、字节在AI人才和资金上的继续投入，潮水退去，大模型在决胜战场的主导权还是来到了大厂手中。

1/14/2025 2:52:00 PM

陈彩娴

同时提升摄像机控制效率、视频质量，可控视频生成架构AC3D来了

可控的视频生成需要实现对摄像机的精确控制。然而，控制视频生成模型的摄像机运动（camera control）总是不可避免地伴随着视频质量的下降。近期，来自多伦多大学、Vector Institute、Snap Research 和西蒙・弗雷泽大学（SFU）的研究团队推出了 AC3D (Advanced 3D Camera Control)。

1/14/2025 2:02:05 PM

机器之心

思维链？思维树？华为诺亚：现在到了思维森林时刻！

OpenAI 接连发布 o1 和 o3 模型，大模型的高阶推理能力正在迎来爆发式增强。在预训练 Scaling law “撞墙” 的背景下，探寻新的 Scaling law 成为业界关注的热点。高阶推理能力有望开启新的 Scaling law，为大模型的发展注入新的活力。

1/14/2025 1:52:56 PM

国产推理大模型决战2025考研数学，看看谁第一个上岸？

随着上个月 2025 研究生考试的结束，最新的考研数学真题成为大语言模型尤其是推理模型的「试炼场」，将考验它们的深度思考能力。业内曾有着这样一种共识：大语言模型在文字水平上的表现令人印象深刻，但说到数学就不甚令人满意了。去年一度火出圈的「9.9 与 9.11」比大小的问题，包括 GPT-4o 在内的很多大模型都翻车了，直到深度推理模型出现后才从根本上改善了这一状况。

1/14/2025 1:51:18 PM

物理学家发现新型量子粒子！表现介于玻色子费米子之间 | Nature

新型量子粒子出现了，相关论文已经登上Nature。事情是这样的，美国布朗大学物理学家发现了一类既不属于玻色子，也不属于费米子的新粒子，这种粒子的表现介于两种基本粒子之间，被称为“分数激子”。研究人员表示，这种新粒子不携带整数电荷，却遵循独特的量子统计规律。

1/14/2025 12:28:01 PM

量子位

霉霉用中文拜早年！国风年味视频免费生成，可任意切换主角，0帧起手小白友好

新一年，霉霉也来送祝福啦，完全中文版哦。几十米高的大熊猫爬上了长城。鱼尾狮成了它把玩的玩具。

1/13/2025 1:50:25 PM

量子位

会用AI才能多发论文，LLM助力科研效率提升！新研究登Nature子刊

都说大模型被广泛应用于学术研究的文献回顾、摘要筛选和稿件撰写等方面，然而具体多少人在使用、如何使用，却缺少定量的调查研究。为此，研究人员进行了一项调查，识别受访者们在学术研究和发表中使用大模型的情况。以评估全球研究人员对大模型的认知水平。

1/13/2025 1:00:00 PM

新智元

基于阿里开源Qwen2.5-7B-Instruct模型进行多代理RAG开发实战

译者 | 朱先忠审校 | 重楼引言大型语言模型已经展现出令人印象深刻的能力，并且随着每一代新模型的发布，它们仍在稳步改进。例如，聊天机器人和自动摘要器等应用程序可以直接利用LLM的语言能力，因为这些LLM只要求生成文本输出——这也是该类模型的自然设置。此外，大型语言模型还表现出了理解和解决复杂任务的令人印象深刻的能力，但是只要它们的解决方案保持“纸上谈兵”，即纯文本形式，那么它们就需要外部人类用户代表它们行事并报告所提议操作的结果。

1/13/2025 10:55:53 AM

朱先忠

LLM注意力Attention，Q、K、V矩阵通俗理解

QKV的重要性要理解大语言模型效果的底层实现原理，很大一部分就是理解Transformers Block里面的QKV矩阵。现在前沿的大模型研究工作很大一部分都是围绕着QKV矩阵去做的，比如注意力、量化、低秩压缩等等。其本质原因是因为QKV权重占比着大语言模型50%以上的权重比例，在推理过程中，QKV存储量还会随着上下文长度的增长而线性增长，计算量也平方增加。

1/13/2025 8:23:07 AM

咚咚呛

GAN已死？GAN万岁！布朗康奈尔新作爆火，一夜碾压扩散模型

GAN已死？不，GAN又回来了！此前曾掀起AI圈巨大风暴的GAN，后来却逐渐沉寂了，甚至有人发出了「GAN已死」的论调。

1/13/2025 8:20:00 AM

新智元

OpenAI 不装了？左手赚钱，右手就一定有「神奇药水」吗？

近期，OpenAI CEO Sam Altman 一反此前的「故弄玄虚」「卖关子」，在其博客文章中明确表示，「已经知道如何构建通用人工智能（AGI）」。为何 Sam Altman 这次如此笃定地表示已经明确知道如何做 AGI？要知道，在此前 OpenAI 官方发布的 AGI 路线图中，OpenAI 表示目前尚在 AGI 的 L2（推理者）阶段，在朝着 L3 阶段前进。

1/13/2025 8:00:00 AM

机器之心

可灵AI破解电车难题全员无伤！网友：这就是东方智慧吗

大跌眼镜！经典电车难题就这样被可灵AI解决了？！

1/13/2025 7:30:00 AM

量子位

突破瓶颈！北航ETH等将扩散模型完全量化至1bit，28倍存储节省+52.7倍效率提升

将扩散模型量化到1比特极限，又有新SOTA了！来自北航、ETH等机构的研究人员提出了一种名为BiDM的新方法，首次将扩散模型（DMs）的权重和激活完全二值化。具体而言，作者们从时间和空间的角度对扩散模型进行了优化：从时间角度来看，引入了“时间步友好二值结构”（TBS），通过可学习的激活二值化器和跨时间步特征连接来应对DMs高度时间步相关的激活特征。

1/13/2025 7:00:00 AM

量子位

不停PUA大模型「写更好点」，无需其它花哨技术就能让AI代码水平暴增

AI 的编程能力已经得到了证明，但还并不完美。近日，BuzzFeed 的资深数据科学家 Max Woolf 发现，如果通过提示词不断要求模型写更好的代码（write better code），AI 模型还真能写出更好的代码！这篇文章在网络上引发了热议，著名 AI 科学家在看完这篇文章中更是发出了 matters 三连：迭代很重要，提示词设计很重要，代码执行能力很重要。

1/11/2025 3:37:00 PM

机器之心

英伟达迷你超算遭友商嘲讽：宣传FP4算力，实际“不如买个游戏电脑”

老黄在CES上发布的迷你超算Project DIGITS，开启了AI超算的PC时刻。但随即也引发了不小争议，还遭到了大佬的贴脸嘲讽。在AMD和英特尔都工作过的芯片设计专家Raja Koduri实名吐槽道：FLOPs除以4，价格翻倍，这就是在CES上stay grounded的秘诀。

1/10/2025 2:15:47 PM

量子位

AMD把o1炼成了实验室助手，自动科研经费节省84%

芯片强者AMD最新推出科研AI，o1-preview竟成天选打工人？注意看，只需将科研idea和相关笔记一股脑丢给AI，研究报告甚至是代码就能立马出炉了。这个AI系统代号“Agent Laboratory”，全程由LLM（大语言模型）驱动完成文献综述、实验，以及报告，一站式搞定科学研究。

1/10/2025 2:14:44 PM

企业软件是否已告别“太贵”时代？

在不太遥远的未来，GenAI将使企业软件领域以往无法实现或成本过高的功能成为可能。 GenAI，尤其是大型语言模型(LLM)，正在改变公司开发和交付软件的方式。从聊天机器人和简单自动化工具开始的这一进程，正在发展成为功能更为强大的AI系统——这些系统与软件架构深度融合，并影响从后端流程到用户界面的方方面面。

1/10/2025 2:03:38 PM

资讯热榜

OpenAI开源超Agent:Codex CLI,五小时内破 5000 颗星 ChatGPT重磅更新：新增图像库功能，可查看自己用GPT生成的所有图片本地部署DeepSeek+DiFy平台构建智能体应用 OPPO 小布助手网页版上线，接入满血版 DeepSeek OpenAI 发布“智能体构建实战指南”实用性文档（附文档资源） OpenAI发布34页智能体实践指南：从网络搜索到代码编写韩国初创公司 RLWRLD 获 1480 万美元融资，致力于机器人基础模型开发 AI视频用哪个？6个知名的AI视频工具使用测评报告

标签云

人工智能 OpenAI AIGC AI ChatGPT DeepSeek AI绘画数据机器人谷歌模型大模型 Midjourney 智能用户学习开源 GPT 微软 Meta AI创作图像技术论文 Stable Diffusion 马斯克 Gemini 算法蛋白质生成式芯片代码英伟达腾讯神经网络计算研究 Sora AI for Science 3D Anthropic AI设计机器学习 GPU 开发者场景华为预测伟达 Transformer 百度人形机器人苹果深度学习 AI视频模态字节跳动 xAI 驾驶文本搜索大语言模型 Claude Copilot 具身智能神器推荐 LLaMA 算力安全应用视频生成科技视觉亚马逊干货合集 2024 AGI 特斯拉训练大型语言模型