AIHOT

4月29日

22:17

Tencent Hy@TencentHunyuan

精选67

腾讯开源Hy-MT1.5-1.8B-1.25bit翻译模型，440MB体积支持手机离线运行

腾讯开源了Hy-MT1.5-1.8B-1.25bit翻译模型，其参数量为18亿，经量化后仅440MB，可在手机上完全离线运行。该模型支持33种语言、5种方言及1056个翻译方向，包括藏语、蒙古语等少数语言。在标准测试中，其性能媲美商业翻译API和2350亿参数的大模型。通过量化至1.25比特，模型内存占用从FP16格式的3.3GB大幅降低，比之前的1.67比特方法体积缩小25%、速度提升约10%，且无精度损失。该模型已在国际机器翻译竞赛中获得30项第一，并部署于腾讯多个产品中。

Hugging Face开源生态模型发布端侧

推荐理由：440MB的模型能在手机上跑33种语言翻译，还宣称比谷歌翻译强，这个量化技术让离线翻译不再是‘能看不能用’，出差党可以试试看。

22:10

TestingCatalog News 🗞@testingcatalog

54

SenseTime开源了基于NEO-Unify架构的多模态图像生成模型SenseNova-U1。该架构完全摒弃了传统视觉编码器和VAE，原生地将理解、推理和生成统一为一个系统。该系列模型（8B和A3B参数）在开源模型中效率领先，以紧凑尺寸提供商业级性能与出色成本效益。其特色功能包括原生生成图文交织内容，适用于制作指南等实用场景；并擅长高密度信息渲染，能生成知识插图、海报、PPT和漫画等丰富结构的布局。模型已在Hugging Face和GitHub等平台开源。

图像生成多模态开源生态模型发布

17:41

The Decoder：AI News（RSS）

55

通过 Nemotron 3 Nano Omni，Nvidia 揭示了现代多模态模型的真实构成

Nvidia 发布了开源多模态模型 Nemotron 3 Nano Omni，该模型能够处理文本、图像、视频和音频。其引人关注之处不仅在于性能表现，更在于其训练数据的构成。模型的部分训练数据来源于 Qwen、GPT-OSS、Kimi 和 DeepSeek OCR 等多个知名项目，这揭示了构建现代多模态模型所需数据集的多样性与复杂性。

多模态开源生态模型发布

17:33

IT之家（RSS）

65

腾讯混元开源手机端离线翻译模型 Hy-MT1.5-1.8B-1.25bit，仅 440MB

腾讯混元开源了手机端离线翻译模型Hy-MT1.5-1.8B-1.25bit，其体积仅440MB，可在手机本地离线运行。该模型支持33种语言及1056个翻译方向，基于1.8B参数原型通过极致量化压缩实现。其1.25-bit版本采用稀疏高效三值量化技术，将原始3.3GB模型大幅缩减。官方称其翻译质量优于谷歌翻译等主流系统，并提供了2-bit和1.25-bit两种量化方案以适配不同机型。模型完全离线工作，不收集用户数据，相关资源已全面开源。

arXivHugging Face模型发布端侧

17:16

SenseTime@SenseTime_AI

56

感谢 @liuziwei7 与我们共同创造 #多模态智能的未来！

Hugging Face多模态开源生态模型发布

关联讨论 1 条

16:46

SenseTime@SenseTime_AI

精选65

是的，SenseNova U1 现已在 Hugging Face 和 GitHub 上发布！探索它如何以语义精确性和像素级保真度实现复杂的 #信息图创作。 Hugging Face： https：//huggingface.co/collections/sensenova/sensenova-u1 GitHub： https：//github.com/OpenSenseNova/SenseNova-U1 Discord： https：//discord.gg/cxkwXWjp

Hugging Face图像生成多模态模型发布

推荐理由：SenseNova U1 开源了，能生成像素级精准的信息图，对于做电商和可视化的人是个直接可用的工具，值得跑一下看看实际表现。

16:33

IT之家（RSS）

44

科大讯飞总裁吴晓如：今年 10 月将在华为昇腾 950 平台上发布国产旗舰大模型

科大讯飞总裁吴晓如宣布，公司计划于今年10月在华为昇腾950平台上发布国产旗舰大模型，该模型将直接对标业界最先进主流模型。此前，科大讯飞已发布星火X2-Flash模型，采用MoE架构，总参数达30B，最大支持256K上下文，基于华为昇腾910B集群训练完成。财务数据显示，2026年第一季度营业总收入为52.74亿元，同比增长13.23%；归母净利润为-1.70亿元，同比增长12.17%。

数据/训练行业动态

16:33

IT之家（RSS）

59

腾讯多款 Agent 智能体亮相 2026 数字中国建设峰会，混元 Hy3 preview 语言模型同步迎来展会首秀

在2026数字中国建设峰会上，腾讯展示了其Agent智能体生态。其中，WorkBuddy桌面智能体工作台可根据一句话描述自动完成任务；专为中国用户优化的AI技能社区“SkillHub”已集成腾讯核心产品能力，并收录超3.5万个技能。最新发布的混元Hy3 preview语言模型首次亮相，该模型为混合专家模型，总参数295B，支持256K上下文，在复杂推理、代码等能力上大幅提升，旨在助力中小企业低成本快速搭建AI应用，并已在腾讯云、元宝等多款产品中上线。

智能体推理模型发布

15:38

HuggingFace Daily Papers（社区热门论文）

59

Step-Audio-R1.5 技术报告

当前大型音频语言模型普遍依赖基于验证奖励的强化学习范式来驱动听觉推理，但这陷入了“可验证奖励陷阱”——模型为追求孤立文本标签的正确性，牺牲了声学细微差别和对话自然度，导致交互机械、沉浸感差。Step-Audio-R1.5 通过转向基于人类反馈的强化学习实现了范式突破。评估表明，它在保持强大分析推理能力的同时，显著提升了交互体验，特别是在长轮对话中改善了韵律自然性与情感连续性，重新定义了深度沉浸式语音对话的边界。

推理模型发布语音

15:33

IT之家（RSS）

53

科大讯飞星火 X2-Flash 模型发布：基于华为昇腾 910B 集群训练，最大 256K 上下文

科大讯飞正式发布星火 X2-Flash 模型并开放API。该模型采用MoE架构，总参数300亿，支持256K上下文，基于华为昇腾910B集群训练。其在智能体、代码等能力上大幅提升，在深度研究报告、Skill管理等多项任务上效果接近业界万亿参数模型，而整体token消耗不到主流大尺寸模型的三分之一。通过结合DSA与MTP技术，模型在国产芯片上的训练效率从同规模A800集群的20%提升至90%，并解决了长交互场景采样效率低的问题，为大规模强化学习训练扫清障碍。AstronClaw、Loomy等已率先接入。

MCP/工具推理模型发布

14:49

Alibaba Cloud@alibaba_cloud

精选64

HappyHorse 1.0 现已在 @fal 上线。去构建吧。【引用 @fal】：Happy Horse 1.0 is live on fal， day 0 🐎 🎬 一流的运动质量 🎧 原生1080p，音频同步一步完成 🔗 音视频联合生成，非拼接 🔓 限制更少，商业用途更广 ⚡ 为生产规模而构建

多模态模型发布视频

关联讨论 1 条

推荐理由：阿里云不声不响丢了个跟 Sora 对标的视频生成模型，音画同步一镜出片，直播带货团队可以立刻试试。

14:40

Ant Ling@AntLingAGI

58

服务好LLM是一项具有挑战性的任务，它需要工程智慧和良好的品味。感谢@Modular团队高水平的工程师们让这次合作成为现实。生态系统必胜！🤠👏

智能体开源生态模型发布

11:19

蚂蚁 inclusionAI：HuggingFace 新模型

51

inclusionAI/Ling-2.6-1T

inclusionAI 发布了 Ling-2.6-1T 模型，这是一个包含 1 万亿参数的大型语言模型。该模型基于开源与开放科学理念构建，旨在推动人工智能技术的进步与民主化。新模型在多项基准测试中展现出更强的语言理解与生成能力，同时提供了更高效的推理性能。这一发布标志着开源社区在规模化 AI 模型开发上的重要进展，为研究者和开发者提供了可访问的高性能工具。

Hugging Face开源生态模型发布

关联讨论 1 条

10:37

Chubby♨️@kimmonismus

40

Mistral Medium 即将到来。唯一相关的欧洲AI公司将发布另一个模型。

开源生态模型发布

09:38

ginobefun@hongming731

49

NVIDIA发布多模态模型Nemotron 3 Nano Omni

NVIDIA发布了多模态模型Nemotron 3 Nano Omni，专为处理长上下文设计，能够同时理解文本、图像、音频和视频。该模型在文档分析、自动语音识别、音视频理解以及智能体计算机使用等实际应用场景中表现优异。在多项基准测试中，Nemotron 3 Nano Omni均展现出领先的准确性和效率。

多模态模型发布端侧

09:35

阿绎 AYi@AYi_AInotes

精选76

蚂蚁发布Ling-2.6系列模型，以极致token效率推动AI生产落地竞赛

蚂蚁集团发布Ling-2.6系列模型，通过MoE架构与Fast-Thinking机制，将推理激活率降至7%，在实现接近GPT-5.4非推理水平综合智能的同时，大幅降低token成本。该模型在SWE-bench Verified等真实Agent场景测试中表现领先，旨在解决Agent规模化应用的成本痛点。目前已在OpenRouter提供免费API并即将开源，推动行业焦点从刷榜转向生产落地。其高效率特性尤其适合高频任务，在部分任务中速度比Claude Sonnet 4.6快6倍、成本低50倍。

阿绎 AYi：后续来了兄弟们，卧槽真的太炸了，同样的任务，同样的配置，速度比Claude Sonnet 4.6还快 6 倍，成本低约 50 倍， openrouter 和官…

智能体推理评测/基准

关联讨论 2 条

推荐理由：把 token 成本砍到对手四分之一而智能分不降，Agent 规模化终于有了真正的成本解决方案，做 Agent 的必看。

09:33

IT之家（RSS）

60

蚂蚁集团百灵大模型开源 Ling-2.6-flash，提供 BF16、FP8、INT4 等版本

蚂蚁集团百灵大模型宣布开源Ling-2.6-flash，提供BF16、FP8、INT4等多个版本供开发者灵活选用。该模型总参数量104B，激活参数7.4B，是一款Instruct模型。官方基于开发者反馈优化了中英文切换及主流编程框架适配效果。其核心优势包括：采用混合线性架构，在4卡H20上推理速度最快达340 tokens/s；通过Token效率优化，在评测中消耗的tokens仅为同类模型的约1/10；针对Agent场景增强了工具调用与任务执行能力，在多项评测中达到先进水平。模型已在Hugging Face和ModelScope平台开源。

智能体开源生态模型发布

08:38

Berryxia.AI@berryxia

65

OpenBMB发布的MiniCPM-o 4.5是一个仅90亿参数的多模态模型，实现了从传统轮询交互到实时、原生全双工流式交互的范式突破。其Omni-Flow框架能在统一时间线上毫秒级同步处理视频、音频和文本流，无需外部语音检测即可同时感知与响应。该模型在多模态基准测试中表现接近Gemini 2.5 Flash，并专为边缘AI设计，支持完全离线运行，提供Windows/macOS一键安装（仅需12G显存），保障100%数据隐私，同时开源权重并提供免费社区API。

GitHub多模态开源生态模型发布

08:33

IT之家（RSS）

65

英伟达推出 Nemotron 3 Nano Omni 模型：采用 30B-A3B 混合 MoE 架构，吞吐量最高提升 9.2 倍

英伟达发布开源全模态推理模型Nemotron 3 Nano Omni，采用30B‑A3B混合MoE架构，集视频、音频、图像和文本处理于一体。该模型旨在替代多模型链，降低推理成本与编排复杂度。在多项基准测试中表现领先，尤其在视频推理任务中，其系统吞吐量相比其他开放式全模态模型最高提升约9.2倍，文档推理任务最高提升约7.4倍。模型权重、训练配方及数据集已完全开放，支持开发者在各类环境中定制部署。

智能体多模态推理模型发布

07:38

Berryxia.AI@berryxia

67

由前GitHub CTO Jason Warner创立的Poolside AI团队开源了其首个权重模型Laguna XS.2。该模型采用33B总参数、3B激活参数的MoE架构，专为Agentic Coding和长时序任务设计，可在单张GPU上运行，并采用Apache 2.0开源协议。团队同时发布了当前最强版模型Laguna M.1以及Agent Harness，标志着其在智能编码代理赛道成为新的竞争者。

智能体开源生态模型发布编码

07:38

Berryxia.AI@berryxia

60

NVIDIA发布高效开源多模态模型Nemotron 3 Nano Omni

NVIDIA 重磅发布！🚀 Nemotron 3 Nano Omni 多模态开源模型来了！ 🔥 30B 参数 🔥 256K 超长上下文 🔥 最高效开放多模态模型（语言+视觉+语音+视频+音频一体化） 🔥 专为 subagents / Agentic 任务设计 🔥 完全开源（权重 + 数据 + 配方），领跑多项榜单可通过 NVIDIA NIM API 免费试用！完美驱动多代理工作流。

智能体多模态开源生态模型发布

关联讨论 2 条

05:39

AK@_akhaliq

59

Nvidia发布了Nemotron 3 Nano Omni 在Hugging Face上为其制作了一个gradio应用

多模态开源/仓库端侧

02:11

The Decoder：AI News（RSS）

47

一个对1930年后世界一无所知的LLM如何想象2026年

名为“Talkie”的130亿参数语言模型仅使用1931年前的文本训练，其对未来世界的预测呈现出强烈的时代局限性。该模型怀疑第二次世界大战是否会发生，并将2026年想象成一个仍以蒸汽船、铁路和廉价小说为主导的世界。这直观揭示了训练数据的时间范围如何从根本上限制大语言模型对现实发展的认知与预测能力。

数据/训练现象/趋势论文/研究

01:38

Ant Ling@AntLingAGI

57

推文感谢Hugging Face为开源模型的持续发展提供了重要平台。文中强调，token效率是构建实用、可持续协作系统的关键。AntLingAGI最新发布的Ling-2.6-flash模型已加入这场效率竞争，该模型采用MIT许可，具备104B/7.4B激活参数，并创新性地结合了1：7 MLA与Lightning Linear混合注意力机制。其性能表现突出：推理速度高达340 tok/s，并且仅需约1500万tokens即可完成完整的Artificial Analysis评测套件。这一效率显著高于通常需要5000万至1亿tokens的前沿模型，展现出其作为高效协作伙伴的潜力。

开源生态推理模型发布

01:35

阿绎 AYi@AYi_AInotes

66

蚂蚁发布Ling-2.6-1T模型，以token效率革新生产级AI

蚂蚁集团AGI团队发布Ling-2.6-1T模型，其核心创新在于聚焦token效率而非参数规模。该模型采用MoE架构，每次推理仅激活7.4B参数，结合Linear Attention与Multi-Token Prediction技术，在保持接近GPT-5.4非推理水平的高智能同时，将token成本降至可比模型的四分之一。在Artificial Analysis评测中以极低消耗获得高分，并在SWE-bench等硬核Agent场景领先。该模型专为处理海量真实生产请求设计，旨在为高频Agent应用提供高效、低成本的解决方案，并通过免费API策略加速生态布局，预示AI竞赛重心正向真实生产成本效率转移。

阿绎 AYi：后续来了兄弟们，卧槽真的太炸了，同样的任务，同样的配置，速度比Claude Sonnet 4.6还快 6 倍，成本低约 50 倍， openrouter 和官…

智能体模型发布部署/工程

01:08

AK@_akhaliq

44

SenseNova U1 已在 Hugging Face 发布 https：//huggingface.co/collections/sensenova/sensenova-u1

Hugging Face开源生态模型发布

01:03

Ant Ling@AntLingAGI

59

AntLingAGI宣布将其模型Ling-2.6-flash正式开源，该模型此前在OpenRouter平台上曾以"Elephant Alpha"为名提供API服务。目前，模型已在Hugging Face和ModelScope平台全面开放，供公众自由使用与构建。模型关键参数为总参数量1040亿，激活参数量74亿，在Artificial Analysis基准测试中输出速度约为每秒215个token，并支持BF16、FP8和INT4多种精度格式。此次开源得到了合作伙伴Novita Labs，以及lmsysorg的SGLang团队和vllm项目的技术支持。

开源/仓库模型发布端侧

00:53

Ant Ling@AntLingAGI

59

vLLM项目团队宣布对Ling-2.6-flash模型提供Day-0首发支持，体现了开源生态系统构建者之间的高效协同。Ling-2.6-flash是一个专为需要快速响应和强大执行力的现实世界智能体设计的即时指令MoE模型。其核心特点包括：1040亿总参数与74亿激活参数的高度稀疏混合专家架构，结合了1：7 MLA与Lightning Linear注意力机制，支持262K上下文长度，并具备原生工具调用能力，可无缝接入Claude Code、Kilo Code、Qwen Code、Hermes、OpenClaw等主流框架。

智能体开源生态模型发布

00:37

Hugging Face：Blog（RSS）

精选70

介绍 NVIDIA Nemotron 3 Nano Omni：面向文档、音频和视频智能体的长上下文多模态模型

NVIDIA 发布了 Nemotron 3 Nano Omni 模型，这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据，旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中，提升了在复杂跨模态场景下的处理效率与应用灵活性。

多模态模型发布端侧

关联讨论 2 条

推荐理由：NVIDIA 把多模态长上下文塞进 Nano 级别模型，文档、音频、视频 Agent 通吃，做端侧多模态应用的团队值得认真看看这个架构思路。

4月28日

23:51

Ant Ling@AntLingAGI

精选62

AntLingAGI与SGLang团队合作，正式推出Ling-2.6-flash（亦称Elephant-alpha）即时指令模型，并在SGLang平台上实现了首发支持。该模型总参数量达104B，但活跃参数仅7.4B，专为低延迟的智能体工作流优化，能够实现即时响应。它在编码、文档处理和智能体任务中展现出极高的token效率，所用token数量显著减少。尽管活跃参数较少，其模型质量仍与当前SOTA水平相当，兼具速度与执行力，适合需要快速响应的生产级智能体应用。团队强调，快速且稳定的推理是提升用户体验的关键。

智能体模型发布部署/工程

推荐理由：104B 总参但只激活 7.4B，蚂蚁这步棋是冲着 Agent 场景的低延迟去的，做 Agent 产品的人值得跑一下看看实际体感。

23:19

Ant Ling@AntLingAGI

59

灵码2.6-flash模型正式开源，专为高效智能体工作流打造

灵码2.6-flash模型现已开源，这是一个专为现实世界智能体工作流构建的快速、高效的指令模型。该模型总参数量达1040亿，激活参数量为74亿，并提供BF16、FP8和INT4多种量化版本以适应不同部署需求。其核心优势包括：生成速度高达每秒215个token，在完整评估中仅消耗1500万token，效率突出；在代码、文档处理和轻量级智能体工作流等实际任务中表现强劲；同时，其中英文切换能力及与主流编程框架的兼容性也得到了进一步改善。

智能体开源/仓库模型发布编码

23:15

OpenRouter@OpenRouter

精选64

@poolsideai 的首批公开基础模型刚刚在 OpenRouter 上发布！ Laguna M.1 和 Laguna XS.2。专为智能体编码和长周期工作从头构建。限时免费 ⬇️

智能体模型发布编码

推荐理由：Poolside 终于把自家模型放出来了，主打长上下文 agentic coding，免费期是薅羊毛窗口。做 coding agent 的团队值得拿 Laguna 跑一轮自己的 benchmark，看看和 Claude、Codex 的真实差距。

20:36

Chubby♨️@kimmonismus

59

Microsoft 推出 "TRELLIS.2"：一个开源的、40亿参数的图像转3D模型，可生成高达15363的PBR纹理资产。基于原生3D VAES，具有16倍空间压缩能力，提供高效、可扩展、高保真的资产生成。说实话，相当酷！

Microsoft多模态开源生态模型发布

20:25

SenseTime@SenseTime_AI

59

SenseNova U1 Lite系列开源，统一多模态理解与生成

SenseNova宣布开源其U1 Lite系列模型。该系列基于NEO-unify架构，原生统一了多模态理解与生成能力。其核心优势包括：在开源模型中具备领先的效率，紧凑的8B和A3B模型在保持商业级性能的同时实现了优异的成本效益；支持原生的图像-文本交织生成，单一模型即可在单次流程中生成连贯交织的图文内容，适用于制作指南等实用场景；并拥有高密度信息渲染能力，擅长为知识图解、海报、PPT、漫画等信息密集型格式生成结构丰富的版式。模型已在Hugging Face、GitHub等平台发布。

图像生成多模态开源/仓库模型发布

18:36

Berryxia.AI@berryxia

56

商汤开源多模态大模型SenseNova-U1，推动本地化部署

商汤发布开源可商用的多模态大模型SenseNova-U1，采用NEO-Unify架构统一处理视觉与语言。其核心功能包括图文交错生成、智能图像编辑与图表渲染。模型提供8B密集版和约3B活性参数的轻量版，适合个人显卡本地部署。现提供每日5小时及1500次免费调用额度，并即将推出办公场景应用功能。

图像生成多模态开源生态模型发布

17:51

蚂蚁 inclusionAI：HuggingFace 新模型

49

inclusionAI发布Ling-2.6-flash-int4模型

inclusionAI团队宣布推出Ling-2.6-flash-int4模型，作为其通过开源与开放科学推动人工智能技术进步与普及的重要举措。该版本延续了团队降低AI应用门槛、促进技术民主化的核心使命，以轻量化技术方案进一步优化模型性能与部署效率。

开源/仓库模型发布端侧

13:33

Alibaba Cloud@alibaba_cloud

53

Qwen3.6全系列模型已在NetMind平台上线，专为不同生产场景的智能体应用设计。该系列包含三个模型：Qwen3.6-Plus专注于前沿推理和长上下文，适用于复杂编码任务；Qwen3.6-Flash强调速度、规模和成本效益，适合大规模实时编码辅助；Qwen3.6-35B-A3B提供开源权重和Apache 2.0许可，支持自主托管和微调。所有模型共享高效的混合架构，具备函数调用和推理能力，并运行在NetMind的低延迟基础设施上，提供统一的OpenAI兼容端点。平台还提供即用代码，便于开发者快速集成和使用。

智能体模型发布编码

11:50

蚂蚁 inclusionAI：HuggingFace 新模型

51

inclusionAI/Ling-2.6-flash-fp8

inclusionAI 团队发布了 Ling-2.6-flash-fp8 模型，致力于通过开源与开放科学推动人工智能的发展与普及。该版本采用 FP8 精度优化，显著提升了推理效率并降低了计算资源消耗，是其在推进技术民主化进程中的最新实践。

开源/仓库模型发布端侧

11:27

蚂蚁 inclusionAI：HuggingFace 新模型

精选55

inclusionAI/Ling-2.6-flash

inclusionAI发布了Ling-2.6-flash模型。该模型是其开源语言模型系列的最新成员，旨在通过开源与开放科学推动人工智能的进步与民主化。此次发布延续了团队降低AI技术使用门槛、促进更广泛社区参与开发的使命。

开源/仓库模型发布端侧

推荐理由：蚂蚁 inclusionAI 的 Ling-2.6-flash 上线 HuggingFace，名字带 flash 大概率是轻量推理模型，但官方描述几乎空白，没有 benchmark 也没有用例，建议等社区实测再决定是否投入精力。

10:47

Simon Willison 博客

65

介绍 talkie：一个源自1930年的130亿参数复古语言模型

Nick Levine、David Duvenaud 和 Alec Radford 发布了 talkie，这是一个基于1931年前历史英文文本训练的130亿参数语言模型。其基础版本在2600亿token的已过版权数据上训练，而指令微调版本则用于驱动聊天界面。该版本借助Claude等现代模型生成合成数据进行训练，可能导致年代错位的知识污染。项目旨在探索此类模型预测未来、超越知识截止点进行发明等能力，并希望最终构建一个完全由复古模型自举的训练流程。模型采用Apache 2.0许可。

开源/仓库数据/训练模型发布端侧