Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
开源项目 LLMSearchRecommender 聚焦于将大语言模型(LLM)与现代人工智能技术应用于搜索与推荐系统。该项目在 GitHub 上开源,旨在探索和整合 AI 驱动的信息检索与个性化推荐工程实践。由于原始分享仅提供了代码仓库链接,具体的技术架构、功能特性和实现细节仍需参考该项目的最新文档。
该文章讨论了如何利用人工智能工具协助和参与开源软件项目的开发与贡献。由于输入信息仅包含文章标题和链接,具体的方法、实践案例及详细观点暂未披露。
该内容探讨了尚处在 Alpha 测试阶段但周下载量已突破 16 万次的开源图表库 TanStack Charts。作为知名开源工具集 TanStack 生态旗下的新项目,其在前端开发者群体中引发了较高关注。由于原始素材未提供详细正文内容,关于其核心架构特性、支持的图表类型、渲染性能以及受社区青睐的具体技术原因等详细信息尚不明确。
随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。
本次提供的素材仅包含标题“Open Source”,未提供任何正文或摘要内容。由于缺乏实质性事实与上下文背景,无法提取具体的技术发布、项目更新或行业事件细节。鉴于信息严重不足,无法提供进一步展开的有效分析或报道。
Git 提交历史重写工具 commit-rewriter 发布 0.2 版本。该版本新增了对非默认分支的处理支持,用户现在可以通过命令行参数 `--branch` 指定目标分支进行操作,例如使用 uvx commit-rewriter --branch other。该更新进一步提升了开发者在多分支项目中进行代码提交重写时的灵活性。
开源数据探索与发布工具 Datasette 正式发布 1.0a41 预览版本。该版本新增了由 Alec Garcia 贡献的 OpenTelemetry 可观测性支持,增强了系统的追踪与监控能力。此外,作者对 Datasette 内的所有模态对话框进行了重构,整合为统一的 Web Component 组件,并补充了相关开发文档,方便第三方插件调用与扩展。
世界人工智能开源大赛(GOAI)总决赛暨颁奖盛典于杭州顺利举行。该赛事旨在聚集与展示人工智能开源领域的创新成果与技术人才。需要说明的是,由于当前原始素材仅包含标题及原文跳转提示,缺乏正文具体内容,大赛的赛题方向、各赛道获奖名单、评委阵容以及具体发布项目等详细信息均未公开展示,后续进展有待进一步报道补充。
Black Forest Labs 宣布进军机器人领域,推出开源世界动作模型 FLUX 3 Action。该模型参数量仅为 70 亿(7B),可通过摄像头输入的图像流实时预测机器人下一步的操作动作。评测结果显示,FLUX 3 Action 在 RoboLab-120 基准测试中刷新了纪录,且运行速度比此前顶尖模型最高快出 3.95 倍。
Potluck 是一款旨在降低大模型硬件门槛的分布式计算工具。针对个人开发者难以承担高昂 GPU 集群或云算力成本的问题,该项目允许用户将手头的多台普通设备(如笔记本电脑、游戏台式机等)组网连接,协同聚合算力以运行更大参数的本地模型。目前可用于家庭或办公室内的多设备互联,未来目标是构建一个由用户自有设备组成的分布式网络,实现相互共享算力支持大模型推理。
开发者在 Hacker News 上发布了新项目 Enclawed,该项目被定义为一个面向 AI Agent 网关的硬分叉安全加固框架,旨在提升智能体网关系统的安全防护与健壮性。目前素材仅提供了项目名称与访问链接,关于其具体的技术实现路径、加固机制以及核心特性的详细信息尚显不足。
Paperclip 是一款专注于 AI 智能体团队协作编排的开源工具,旨在为多智能体系统的调度与协同工作流提供支持。通过该项目,开发者可以更便捷地组织多个 AI Agent 共同处理复杂任务。需要注意的是,当前提供的素材信息较为有限,仅包含项目的开源代码库链接及简要功能定位,具体的底层架构、核心功能特性与实际应用示例等细节仍有待后续补充公开。
9月18日,亚马逊云科技宣布其大模型服务平台Bedrock正式托管国产开源模型Kimi K3。尽管国产模型上线海外云平台此前已有先例,但作为开源模型直接吸引美国主流云厂商采购付费尚属罕见。此举标志着中国开源大模型的技术实力与应用价值进一步获得硅谷云巨头的商业认可,也展现了海外云厂商围绕优质开源模型开展商业化合作的新动向。
清华大学联合无问芯穹正式开源具身智能云原生平台RLark,旨在打造具身智能基础设施的新“塔台”。该平台支持高效的机器人设备管理与调度,可实现5分钟内完成机器人纳管,并在10秒内快速启动跨集群任务,为具身智能应用的大规模部署和跨集群高效协同提供了底层云原生支撑。
针对医学系统评价中数据提取高度依赖人工且必须遵循严格协议与可审计要求的痛点,研究团队推出了开源、无代码的 Web 平台 EviStreams。该平台引入人在回路的大语言模型辅助机制,不仅契合双人独立提取、裁决仲裁的标准审查流程,还能记录完整的数据生成审计日志,使科研团队在关键阶段自主把控 AI 提取过程,显著缓解临床指南研制中的专家人力瓶颈。
该技术报告介绍了开源大语言模型Hunyuan-A13B。该模型采用混合专家(MoE)架构,总参数量为800亿,推理时仅激活130亿参数,有效兼顾了模型性能、计算效率与部署成本。模型在经过严格清洗且强化STEM领域的20T token语料上进行预训练,并结合高质量SFT与大规模强化学习,同时引入了双模式思维链(CoT)框架,显著提升了事实可靠性与逻辑推理能力。
虽然放射科 AI 在胸部 X 光、病理切片及 2D 影像检测中已取得显著进展,但针对临床信息更为丰富的 3D CT 影像理解仍面临挑战。为此,相关研究推出了开源 3D CT 视觉语言模型 NV-Reason-CT。该模型旨在引入放射科医生的思维链(Chain-of-Thought)推理机制,强化 AI 对三维医学断层扫描数据的深度解读与逻辑分析能力,助力复杂的临床影像辅助诊断。
本文介绍了如何将开源终端原生 AI 编码智能体 OpenCode 与 Amazon Bedrock 上的开放权重模型结合,打造安全、灵活且按需付费的代码助手。开发者可以配置多模型工作流,为不同任务匹配适合的模型,并在无需管理底层基础设施的情况下,将所有数据保留在自己的 AWS 账户内,兼顾开发效率与数据安全性。
文章探讨了开源领域中最具挑战性但鲜少被公开讨论的议题——中立性。作者指出,当开发者接受特定机构或企业支付的薪资时,在开源项目中保持客观与中立会变得极其复杂;同时,坦诚面对这一潜在利益冲突所付出的努力也远超多数人的认知。素材仅提供了初步引言,主要围绕开源贡献者在企业利益与社区中立之间的身份权衡展开思考。
在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。
本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。
开源命令行工具与 Python 库 llm 发布 0.36 版本。新版本新增了对 gpt-6-sol 和 gpt-6-luna 模型的支持;模型插件现可声明 supports_conversation = False,用于处理仅支持单轮提示词的模型,并在接收对话历史时主动报错;同时,llm logs 的 Markdown 输出中将推理链跟踪折叠显示,并修复了多项社区贡献的问题。
随着 Kubernetes 的广泛采用,应用管理已从单纯运行容器转向应对复杂的应用生命周期。现代平台需支持无状态服务、有状态数据库、批处理以及 AI 等工作负载,并在升级、伸缩和基础设施故障时保持高可用。SIG Apps 负责的 Deployments、StatefulSets、Jobs 等核心工作负载组件,构成了整个生态系统部署与运维的基础,该小组正致力于持续优化现代复杂负载的管理体验。
开源命令行 LLM 工具插件 llm-anthropic 发布 0.29 版本。该更新主要新增了对 Claude Opus 5.5 模型的调用支持,允许开发者通过命令行参数直接指定该模型并进行提示词交互与工作流集成。
开发者发布了适用于 LLM CLI 工具的全新插件 llm-typesafe 0.1a0,新增对 TypeSafe AI 旗下 Jev 模型的调用支持。用户通过安装该插件并配置对应 API 密钥后,即可利用 Jev 模型执行结构化判定任务,例如针对文本的是非概率判断(输出置信度得分),以及在预设条件下的多类别选择与意图路由,便于在命令行及自动化工作流中集成类型安全的模型交互。
本文记录了作者首次参加 KubeCon + CloudNativeCon 印度大会的个人经历与感悟。与多数开发者先以普通参会者身份逐步融入社区的路径不同,作者首次参与该会议便直接以演讲嘉宾的身份登台分享,展现了其融入云原生开源社区的独特视角与现场交流体验。
为帮助开发者在动态环境中构建具备感知、推理和行动能力的复杂机器人应用,英伟达发布了基于开源机器人操作系统 ROS 的 GPU 加速软件套件 NVIDIA Isaac ROS 5.0。该版本旨在提供新型物理 AI(Physical AI)模型与工具链,进一步推动具备自主能力的智能体机器人及开源机器人开发进程。
xAI发布Grok 4.7模型,虽然基础模型更大且宣称提升Token效率,但早期测试反馈其Token效率下降30%至80%、速度更慢且实际使用成本偏高,不过Cursor方面表示生产端中位数Token消耗仅增加约5%。与之形成鲜明对比的是,小米推出的开放权重模型MiMo-V2.6 Pro收获高度评价,并在Artificial Analysis开源模型评测榜单名列前茅,小米同步公开了相关技术报告。
开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。