大模型

英伟达提出全新 Star Attention：10 倍加速大语言模型推理，登顶 Hugging Face 论文榜

大模型如今已具有越来越长的上下文，而与之相伴的是推理成本的上升。英伟达最新提出的 Star Attention，能够在不损失精度的同时，显著减少推理计算量，从而助力边缘计算。

12/5/2024 12:32:54 PM

清源

DeepMind大模型再登Nature：8分钟预测15日天气，准确度超顶尖物理模型，已开源

DeepMind大模型再登上Nature——气象预测大模型GenCast，8分钟内完成15天的预测，而且不管常规还是极端天气都能分析。在97.2%的场景中，GenCast的表现都超过了全球顶尖的中期天气预报系统ENS。不同于DeepMind之前推出的GraphCast的确定性预测，GenCast关注的是各种天气情况的概率。

12/5/2024 12:26:53 PM

AWS宣布新应用市场Amazon Bedrock上线100多个AI模型

AWS正在通过Amazon Bedrock服务向AI应用开发人员提供更多的大型语言模型，同时增强该平台的优化推理工作负载和为他们提供所需数据的能力。 AWS在年度盛会AWS re:Invent上发布的最新公告中包括了推出新的Amazon Bedrock Marketplace，这个主要门户将让开发人员可以访问100多个最强大的大型语言模型，其中包括一些只能在那里找到的大型语言模型。 Amazon .

12/5/2024 11:01:05 AM

新瓜不断！2024NeurIPS最佳论文，花落字节起诉的实习生

时隔两个月，字节模型遭攻击事件又有新后续。今年10月份，字节商业化内部模型商业化内部模型训练遭实习生攻击一事闹得满城风雨，后这位名为田柯宇的实习生便被开除并被要求赔偿字节的侵权损失800万元及合理支出2万元。本以为这个瓜会以字节的“雷霆手段”告一段落，没想到就在刚刚，事件迎来了大扭转。

12/4/2024 2:31:00 PM

郑佳美

“云计算一哥”一口气发布六个大模型、3nm芯片！多模态还要搞Any-to-Any

就在刚刚，云计算一哥亚马逊云科技，在大模型这件事儿上搞了波大的——亚马逊CEO Andy Jassy亲自站台re:Invent24，发布自家新款AI多模态系列大模型，名曰Amazon Nova。而且是一口气涵盖文本对话、图片生成、视频生成，甚至直接吐露一个小目标：将来我们不仅要Speech to Speech，更要Any-to-Any！整体而言，Amazon Nova系列中的所有模型，均以功能和尺寸来划分。

12/4/2024 2:07:42 PM

惊掉下巴！被字节起诉800万实习生，拿下NeurIPS 2024最佳论文

刚刚，恶意攻击字节训练集群的实习生田柯宇，获得了NeurIPS 2024的最佳论文奖。更巧的是，这篇获奖论文，恰恰就是他在字节商业化技术部门实习期间与团队合作发表的。甚至，这篇论文还是NeurIPS 2024第六高分的论文（7,8,8,8）。

12/4/2024 1:30:00 PM

新智元

平安人寿ChatBI：大模型智能化报表的深度实践

一、项目背景和目标1. 项目背景：大模型赋能智能 BI我们先来看一份报告，2023 年，国家发布了《数字中国发展报告》，报告显示我国的数字经济规模已经达到了 50 多亿，位居世界第二。这一成就的取得，离不开像 ChatBI 这样的创新性产品的贡献。

12/4/2024 8:05:46 AM

刘行行

大模型加持下的 Linux 操作系统开发和自动化维护实践

作为国产开源操作系统社区，OpenCloudOS从L1到L3全链路覆盖，从上游社区独立选型软件包，编译、运行不依赖任何其他发行版，做到自主维护、演进，独立修复bug、cve及backport等维护工作。今年3月，OpenCloudOS已率先构建了一套全流程自动化的基础设施和工具平台，实现对3000 大规模软件包的全链路自主研发与自主维护：《如何实现对 3000 软件包的全链路自主研发与维护?》与此同时，OpenCloudOS进一步结合LLM/AI辅助功能，持续提升开发、维护效率和质量，让社区的开发者、软件包的维护者有更多的精力投入到对重要包的掌握和能力建设、新技术新特性的探索和研发中。（本文基于2024.10.16 CID演讲整理）一、解决方案综述这套从上游跟踪到代码同步的全流程自动化维护工具平台，主要包括5个部分及对应的工具，其中红色标识的部分通过LLM/AI辅助进一步提升效率和质量。

12/3/2024 5:00:45 PM

腾讯技术工程

打破GNN与语言模型间壁垒，图辅助多模态预训练框架用于催化剂筛选，登Nature子刊

编辑 | KX吸附能是一种反应性描述符，必须准确预测，才能有效地将机器学习应用于催化剂筛选。该过程涉及在催化表面上的不同吸附构型中找到最低能量。尽管图神经网络在计算催化剂系统的能量方面表现出色，但它们严重依赖原子空间坐标。

12/3/2024 2:42:00 PM

ScienceAI

3DGS自监督预训练全新范式！VisionPAD：三大感知任务全部暴力涨点（港中文&华为）

写在前面 && 笔者理解虽然近一年端到端的自动驾驶发展火热，但是以多视角图像推导BEV视角和占用空间的感知技术引领的自动驾驶框架，仍然在很多企业中占据主体。比如今天要分享的这篇，就是华为诺亚方舟实验室对BEV OCC的继续研究。但是不得不说，这些模型在很大程度上依赖于精确的3D标注，而数据标注的高成本使得越来越多的研究人员和工程师开始关注预训练策略。

12/3/2024 9:49:07 AM

黄哲威 hzwer

轻松掌握 AI 大模型！Windows 新突破：Ollama 赋能本地部署

Ollama—— 这是一个专为本地部署优化的 AI 模型。 Ollama 在模型大小、性能和部署灵活性等方面都有非凡的表现，与传统云端部署相比，它可以轻松运行在普通的台式电脑或笔记本电脑上。这无疑是 AI 大模型的一次重大突破！

12/3/2024 9:11:45 AM

不码不疯魔

清华UCSD提出全新微调方法，8B小模型媲美GPT-4o！科学问题正确率提高28%

我们都知道，在科研界，LLM在解决简单科学问题时表现得游刃有余，但在应对复杂问题时往往会出现幻觉。于是，为了让模型更靠谱，研究人员尝试给模型装上科学工具，帮助它们解决高难度任务。然而，一旦用上工具，模型就「上瘾」了！

12/2/2024 2:20:00 PM

新智元

NeurIPS 2024｜杜克大学&谷歌提出SLED解码框架，无需外部数据与额外训练，有效缓解大语言模型幻觉，提高事实准确性

此项研究成果已被 NeurIPS 2024 录用。该论文的第一作者是杜克大学电子计算机工程系的博士生张健一，其主要研究领域为生成式 AI 的概率建模与可信机器学习，导师为陈怡然教授。大语言模型（LLM）在各种任务上展示了卓越的性能。

12/2/2024 1:50:00 PM

机器之心

美欧亚三洲开发者联手，全球首个组团训练的大模型来了，全流程开源

11 月 22 日，Prime Intellect 宣布通过去中心化方式训练完成了一个 10B 模型。 30 号，他们开源了一切，包括基础模型、检查点、后训练模型、数据、PRIME 训练框架和技术报告。据了解，这应该是有史以来首个以去中心化形式训练得到的 10B 大模型。

12/2/2024 12:47:08 PM

机器之心

图结构转文本序列，大模型直接读懂！图推理性能大涨

大语言模型直接理解复杂图结构的新方法来了：将图（Graph）转换为适合Transformer架构的线性token序列。 belike：这种最新图线性化方法，反映了自然语言中局部依赖性和全局对齐性两个关键属性，即：不仅需要保留基于前文上下文预测下一个token的能力（局部依赖性），而且不同图的token序列应该从具有相似特征的token开始或结束（全局对齐性），就像自然语言文本经常以特定词语开头或结尾。如此一来，在海量文本数据上训练的LLM也能更好地理解图结构中的关系和属性，如节点计数、最大度数计算和图式形状分类等图推理任务都能完成。

12/2/2024 12:37:42 PM

微软：两个AI相互纠错，数学再涨5分

提升LLM数学能力的新方法来了——一个大模型不行，那就两个。让他们彼此合作，纠正对方的错误。这就是来自加州大学和微软研究院的最新研究成果：Flow-DPO。

12/2/2024 12:30:44 PM

微软发明全新「LLM语言」，AI智能体交互效率翻倍！

在《星球大战》中，机器人R2-D2和其他机器人使用特殊的语言进行交流。这种语言主要由蜂鸣声和口哨声组成，被称为「二进制语」（Binary）或「机器人语」（Droidspeak）。 Droidspeak是专门为机器人之间的交流设计的，只有机器人能够完全理解其精确含义。

12/2/2024 10:15:00 AM

新智元

揭秘：为何大模型总是赚不到钱？行业内幕大曝光！

编辑 | 伊风出品 | 51CTO技术栈（微信号：blog51cto）一个扎心的问题：大模型盈利了吗？随着技术的发展，AI 逐渐走下了「神坛」，整个业界都变得更加客观和务实。从OpenAI 今年高达 50 亿的天价亏损，到月暗沸沸扬扬的前投资人仲裁风波，大模型厂商的生意之路不是铺满大额融资的花路，而是充满了坎坷和荆棘。

12/2/2024 9:37:09 AM

伊风

资讯热榜

OpenAI开源超Agent:Codex CLI,五小时内破 5000 颗星 ChatGPT重磅更新：新增图像库功能，可查看自己用GPT生成的所有图片本地部署DeepSeek+DiFy平台构建智能体应用 OpenAI 发布“智能体构建实战指南”实用性文档（附文档资源） OpenAI发布34页智能体实践指南：从网络搜索到代码编写别再只玩ChatGPT了！OpenAI悄悄发布《构建 Agent 实战指南》手把手教你打造智能体韩国初创公司 RLWRLD 获 1480 万美元融资，致力于机器人基础模型开发 OpenAI发布GPT-4.1指令提示工程指南

标签云

人工智能 OpenAI AIGC AI ChatGPT DeepSeek AI绘画数据机器人谷歌模型大模型 Midjourney 智能用户学习开源 GPT 微软 Meta AI创作图像技术论文 Stable Diffusion 马斯克 Gemini 算法蛋白质生成式芯片代码英伟达腾讯神经网络计算研究 Sora AI for Science 3D Anthropic AI设计机器学习 GPU 开发者场景华为预测伟达 Transformer 百度人形机器人苹果深度学习 AI视频模态字节跳动 xAI 驾驶文本搜索大语言模型 Claude Copilot 具身智能神器推荐 LLaMA 算力安全应用视频生成科技视觉亚马逊干货合集 2024 AGI 特斯拉大型语言模型训练