September 16, 2026

Month: August 2026

Gemini Notebook支持导入已购Google Play电子书

2026年8月28日,Google宣布Gemini Notebook新增电子书导入功能,用户可直接将已购Google Play图书接入笔记工具,实现内容摘录、自动摘要与问答交互。这一功能的上线标志着Google正在将其AI能力与数字阅读生态进行深度融合,为用户打造从阅读到知识管理的全链路智能化体验。 Gemini Notebook产品背景 Gemini Notebook是Google推出的AI驱动型笔记与知识管理工具,最早在2025年作为Google Labs的实验性产品亮相。与Evernote、Notion、Obsidian等传统笔记工具不同,Gemini Notebook的核心差异化在于其深度集成了Google的Gemini大语言模型,用户可以在笔记工作流中随时调用AI能力进行文本处理、信息检索、内容生成和知识问答。 Gemini Notebook最初面向研究人员、学生和知识工作者设计,旨在解决信息过载时代的知识管理难题。用户可以在Notebook中创建多个项目(Project),每个项目可上传多种类型的资料,包括本地文档、网页链接、云端文件等。Gemini模型会对上传的资料进行自动索引和分析,用户随后可对这些资料进行提问、摘要和内容整合。 2026年以来,Gemini Notebook经历了多次功能迭代。2026年3月,Google为Notebook添加了来自Google Drive的云端支持,允许用户直接在Notebook中引用来自Drive的文档。2026年6月,Notebook引入了协作功能和共享记忆功能,使团队用户能够在同一项目中进行协作,并共享AI的上下文记忆。2026年8月,Notebook新增了对Google Workspace文档的更多支持,允许用户从Docs、Sheets、Slides中引用内容。而此次Google Play电子书导入功能的加入,使Gemini Notebook在“阅读-笔记-知识管理”这一完整链条上补上了关键的一环。 Google Play图书生态简介 Google...

Google搜索AI Mode升级旅游规划功能

2026年8月28日,Google搜索的AI Mode功能强化了旅游规划场景,现可根据用户预算、时间与偏好,自动生成包含交通、住宿、景点的完整行程方案。Google搜索AI Mode简介Google搜索的AI Mode是Google将生成式AI功能整合到搜索引擎中的核心产品之一。AI Mode于2026年5月正式面向美国地区的搜索用户推出,随后逐步扩展到全球市场。AI Mode与传统的Google搜索体验不同,它采用了对话式的交互方式,用户可以用自然语言提出复杂的问题,AI Mode能够理解并回应用户的多轮追问,提供更加个性化和全面的答案。与Google此前推出的AI Overview(AI概览)功能相比,AI Mode提供了更深入、更交互式的搜索体验。旅游规划功能的升级内容此次升级,AI Mode在旅游规划方面的能力得到了显著增强:完整行程生成:用户只需输入目的地、旅行天数、预算范围和偏好类型(如文化、自然、美食、购物、冒险等),AI Mode即可自动生成优化后的每日行程安排。系统会综合考虑景点间的距离、开放时间、交通方式和合理休息时间,生成符合逻辑且可执行的行程。实时信息整合:AI Mode可深度调用Google生态内的数据资源,包括Google Maps的地理信息、Google Flights的航班数据、Google Hotels的住宿信息等。用户在规划过程中可获得实时的交通方案推荐、住宿价格比较和景点热度信息。个性化推荐:系统根据用户的历史搜索行为、位置记录和偏好数据,提供个性化的景点、餐厅和活动推荐。对于重复访问同一目的地的用户,AI Mode会优先推荐未体验过的新地点或当前热门的活动。动态调整:用户可在AI Mode中与系统进行对话式的调整,比如“我第一天不想太累,减少一个景点”或“我想增加一个博物馆参观”,系统会根据新的需求实时调整行程方案。预算优化:AI Mode可根据用户

 Hugging Face发布开源双足机器人Microduck

2026年8月28日,Hugging Face推出开源双足机器人项目Microduck,提供完整的硬件图纸与控制算法,旨在降低足式机器人研发门槛,推动社区共创。 Hugging Face的机器人战略 Hugging Face是全球最大的AI开源社区平台,托管了数十万个AI模型和数据集。近年来,Hugging Face开始向机器人领域拓展,推出了LeRobot开源机器人库,旨在将AI领域的开源文化和协作模式引入机器人研发领域。 LeRobot库提供了机器人学习算法的参考实现、数据集和工具链,支持研究人员和开发者在机器人领域进行快速实验和创新。Microduck是LeRobot生态中的一个重要硬件项目。 Microduck的硬件设计 Microduck是一个完整的开源双足机器人项目,包括以下硬件组成部分: 3D打印部件:机器人的机械结构采用3D打印制造,设计文件完全开源,用户可使用普通的FDM 3D打印机自行打印。 电机和驱动:项目指定了标准的舵机和电机型号,用户可方便地采购。驱动电路的设计也一并开源。 传感器配置:包括IMU(惯性测量单元)、关节角度传感器、足底压力传感器等,为平衡控制和状态估计提供数据。 控制器:基于主流嵌入式平台(如ESP32、Raspberry Pi Pico等),运行控制算法。 硬件设计的模块化程度较高,用户可根据需要更换或升级特定部件,便于定制化和实验。 控制算法 Microduck的控制算法是其核心软件部分,主要包括:...

AISI发布开源工具optstop以动态优化LLM评估算力

2026年8月28日,AI安全机构AISI正式发布开源工具optstop,该工具可动态调整LLM评估过程中的计算资源分配,在保证评测质量的同时有效节省算力成本。 AISI简介 AISI(AI Safety Institute,AI安全研究所)是一家专注于AI安全研究的机构,致力于确保AI系统的安全、可靠和可控。AISI的研究方向包括AI对齐、鲁棒性评估、可解释性、AI安全治理等。 AISI此前曾发布多项与AI安全相关的研究成果和开源工具,包括AI系统安全性评估框架、模型鲁棒性测试工具等。optstop是其在“高效AI评估”领域的最新贡献。 LLM评估面临的挑战 随着大型语言模型在各类应用中的广泛部署,对模型能力的评估变得越来越重要。然而,LLM评估面临着几个关键挑战: 高昂的计算成本:在标准评估基准上对一个LLM进行全面测试,可能需要运行数万甚至数十万次推理,计算成本可观。 评估时间长:大量推理任务需要较长的时间完成,拖慢了模型迭代和部署的节奏。 资源浪费:许多测试样本对模型来说过于简单或过于困难,在这些样本上消耗算力实际上是在浪费资源。 成本与质量的权衡:在实际开发中,经常需要在评估质量和计算成本之间做出妥协。 optstop的核心机制 optstop的核心思想是在LLM评估过程中,根据任务的复杂度和当前模型的置信度动态决定是否继续分配算力: 动态提前停止:在评估过程中,工具会根据模型的中间输出和置信度分数,判断是否已经可以做出准确的评估判断。对于模型已高度确定的任务,提前终止计算可以节省大量资源。 不确定性感知:对于模型输出不确定性高的任务,optstop会继续分配算力进行更深入的分析,确保评估的准确性。 自适应阈值:optstop支持用户根据具体需求设置不同的置信度阈值,在成本和准确性之间找到最佳平衡。 多种停止策略:工具内置了多种提前停止策略,包括基于置信度的停止、基于熵的停止、基于边际的停止等,用户可根据评估任务的特点选择最合适的策略。 成本效益与性能保障 通过智能截断机制,optstop可在不显著影响评估准确性的前提下实现可观的成本节省:...

阿里云百炼下调Qwen3.8-Flash模型价格

2026年8月28日,阿里云百炼平台正式宣布大幅下调Qwen3.8-Flash模型的调用价格,进一步降低中小开发者和企业使用大模型的门槛。 阿里云百炼平台简介 阿里云百炼是阿里巴巴集团旗下的一站式AI模型服务平台,提供模型训练、部署、调用和管理的全链路服务。百炼平台整合了阿里自研的通义系列模型(Qwen),以及第三方开源和商业模型,为开发者和企业提供了丰富的AI模型选择。 百炼平台的目标是降低AI技术的使用门槛,让更多的开发者和企业能够便捷地应用大模型技术。平台提供了标准化API、SDK、可视化开发工具和丰富的文档支持。 Qwen3.8-Flash模型介绍 Qwen3.8-Flash是阿里云通义系列中的轻量级高效模型,其设计理念是在保持较强性能的同时实现更低的推理成本。与其他通义模型相比,Qwen3.8-Flash具有以下特点: 更小的参数量:在保证基本能力的前提下控制了模型规模,适合资源受限的部署环境。 更快的推理速度:由于参数量较小,推理速度显著提升,适合对延迟敏感的应用。 更低的调用成本:较小的模型规模带来了更低的算力消耗,体现在API调用价格上具有竞争优势。 足够的通用能力:在文本生成、问答、摘要、翻译等常见任务上保持了较好的表现。 易于微调:较小的模型规模使得在特定领域数据上进行微调更加便捷和经济。 价格调整详情 阿里云百炼宣布对Qwen3.8-Flash模型的API调用价格进行大幅下调。具体的价格调整方案包括: 输入token价格下调 输出token价格下调 批量调用享受额外折扣 承诺使用量客户享受更优惠的阶梯定价 虽然官方公告未披露具体数字,但业内人士分析,此次降价的幅度可能在20%-40%之间,具体因使用量和计费模式而异。新的价格体系已在阿里云百炼官方公告中公布,用户可登录阿里云控制台查看最新价格。 对开发者和企业的影响 此次降价对不同类型的用户具有不同的意义:...

全新Qoder发布:推编程与通用双模式及桌面端

2026年8月28日,Qoder迎来全面升级,新增编程辅助与通用助手双模式切换,并同步推出桌面客户端,为用户提供更流畅的跨平台交互体验。 Qoder的产品定位 Qoder是一款AI辅助开发和工作效率工具,致力于帮助开发者和知识工作者在编程和日常工作中提高效率。与专注于特定场景的AI工具不同,Qoder的目标是在一个产品中覆盖从专业开发到日常办公的多种使用场景。 Qoder的竞争产品包括GitHub Copilot(专注于编程辅助)、ChatGPT(通用对话)、Cursor(AI驱动的代码编辑器)等。Qoder的差异化策略在于“双模式一体”的产品设计。 编程模式:深度集成开发工具链 Qoder的编程模式专为软件开发场景设计,提供以下核心能力: 代码生成:根据自然语言描述生成高质量的代码片段,支持Python、JavaScript、Java、C++、Go、Rust等多种编程语言。 代码调试:协助开发者定位代码中的错误和逻辑问题,提供修复建议。 代码优化:对现有代码进行性能优化、重构和简化,提升代码质量。 技术问答:回答编程相关的技术问题,提供文档查询、API使用方法等技术咨询。 单元测试生成:根据函数或模块自动生成单元测试代码,提升测试覆盖率。 代码审查:对提交的代码进行审查,指出潜在问题和改进建议。 编程模式深度集成了开发工具链,可与主流IDE(如VS Code、JetBrains系列)进行联动,支持上下文感知的代码补全和建议。 通用模式:覆盖广泛的日常场景 通用助手模式则覆盖日常问答、文本处理、创意写作等广泛场景: 文本处理:润色、改写、翻译、总结、扩写等文本操作。 创意写作:辅助撰写邮件、方案、报告、营销文案、小说等各类文本内容。 知识问答:回答各领域的常识性问题和专业知识咨询。...

Cohere发布文档解析模型Parse 5

2026年8月28日,Cohere正式推出文档解析模型Parse 5,专注于从复杂版式文档中精准提取信息,显著提升RAG系统对PDF与扫描件的处理质量。 Cohere公司简介 Cohere是一家专注于企业级AI应用的加拿大人工智能公司,由前Google研究人员创立。与OpenAI和Anthropic等专注于通用对话模型的公司不同,Cohere的重点在于为企业提供定制化的AI解决方案,特别是在检索增强生成(RAG)、文档理解和企业搜索等领域。 Cohere的产品矩阵包括: Cohere Command系列:面向企业应用的语言模型 Cohere Embed系列:文本嵌入模型,用于语义搜索和聚类 Cohere Rerank系列:搜索结果重排序模型 Cohere Parse系列:文档解析模型,Parse 5是这一系列的最新版本 Parse 5的技术突破 Parse 5针对复杂版式文档的解析进行了专项优化,解决了传统文档解析工具的多个痛点: 表格解析:能够识别各种复杂的表格结构,包括嵌套表头、合并单元格、跨页表格和多层表头。Parse 5不仅提取表格数据,还能理解表格中各元素之间的逻辑关系。...

 BreezeBlue开源Breeze TTS 2语音模型

2026年8月28日,BreezeBlue团队正式宣布开源新一代语音合成模型Breeze TTS 2。该模型支持多语种、高自然度实时语音生成,开发者可免费下载模型权重进行本地部署。 BreezeBlue团队简介 BreezeBlue是一家专注于AI语音技术的研发团队,致力于推动语音合成、语音识别和语音交互技术的创新与普及。团队此前曾发布Breeze TTS 1.0,在开发者社区中获得了积极反响。Breeze TTS 2是团队在吸收了社区反馈和技术积累后推出的重要升级版本。 Breeze TTS 2的技术亮点 Breeze TTS 2在多个技术维度上实现了显著提升: 语音自然度:合成语音在韵律、语调、停顿和情感表达方面更加接近真人发音。模型能够根据文本的语义内容和标点符号自动调整语速和语调,使合成语音更具表现力。 多语种支持:模型原生支持中文、英文、日文、韩文、法文、西班牙文等多种语言,并可实现多语种混合文本的自然合成。这一特性对于跨国企业、多语言内容创作者和全球化应用开发者具有重要价值。 实时生成能力:模型针对实时应用场景进行了深度优化,推理延迟控制在毫秒级别,支持流式语音生成。这意味着Breeze TTS 2可用于语音助手、实时翻译、有声内容直播等对延迟敏感的场景。...

 Midjourney V8.2图像编辑模型开启测试

2026年8月28日,Midjourney官方宣布,V8.2图像编辑模型正式启动小范围测试。新版本在局部重绘、风格迁移及一致性保持等核心功能上实现了显著增强,测试资格已向部分订阅用户开放。 Midjourney的发展历程 Midjourney是由Midjourney公司开发的AI图像生成工具,自2022年首次推出以来,已成为AI艺术创作领域的代表性产品之一。与Stable Diffusion和DALL-E等其他AI图像生成工具相比,Midjourney以其独特的艺术风格和对细节的高度关注而闻名。 Midjourney的发展经历了多个版本的迭代: V1至V3:早期版本,奠定了文本生成图像的基础能力。 V4:引入了更精细的风格控制和更高的图像质量。 V5:显著提升了图像的真实感和细节表现,支持更丰富的风格变体。 V5.1和V5.2:进一步优化了图像质量和风格控制能力。 V6:实现了在图像真实感、细节丰富度和风格多样性上的重大突破。 V6.1:在V6基础上进一步优化了图像质量和生成速度。 V7:在V6.1发布仅两周后推出,引入了“草稿模式”以加速生成流程。 V8:在图像质量方面实现了“不可否认的巨大飞跃”,新增了图像编辑功能。 V8.1:在V8的基础上进一步优化了图像编辑能力。 V8.2:本次测试的最新版本,聚焦于局部重绘、风格迁移和一致性保持。 局部重绘:精准修改的利器 局部重绘是V8.2最受关注的新功能之一。该功能允许用户选定图像的特定区域,通过文本提示对该区域进行精确修改,而图像的其余部分保持不变。 在技术实现上,V8.2的局部重绘采用了先进的图像分割和生成技术。当用户选定区域并输入修改提示后,模型会: 分析选定区域的边界和内容特征。 理解用户提示的修改意图。...

 fal推出基于MiniMax H3的后训练模型H3 Max

2026年8月28日,AI推理平台fal正式宣布推出H3 Max模型。该模型基于MiniMax H3进行深度后训练强化,在图像理解与多轮对话任务上表现优异,目前已通过fal平台开放API试用。 fal平台的定位与布局 fal是一家专注于AI模型推理优化的平台服务商,致力于为开发者和企业提供高效、低成本的模型部署与调用服务。fal平台的核心竞争力在于其强大的推理基础设施,通过模型量化、算子融合、动态批处理等技术手段,大幅降低模型推理的延迟和成本。 fal与多家领先的AI模型厂商保持着深度合作关系,包括MiniMax、Stability AI、Runway等。fal平台的商业模式是为这些模型提供托管和推理服务,同时收取一定的平台费用。fal不对外披露模型权重,也不通过API提供原始模型的直接访问,而是围绕这些模型构建定制化的应用和工作流。 此次H3 Max的推出,是fal在后训练模型领域的一次重要尝试。与fal平台上托管的其他基础模型不同,H3 Max在MiniMax H3的基础之上进行了有针对性的后训练优化,使其在特定任务上表现更加出色。 后训练:模型优化的关键路径 后训练是指在基础模型完成大规模预训练之后,通过特定数据集和训练策略对模型进行进一步优化的过程。与预训练需要海量通用数据和巨额计算资源不同,后训练通常在较小的数据集上进行,成本相对可控,但能够显著提升模型在特定任务或领域上的表现。 后训练的技术路径主要包括以下几种: 监督微调:使用标注好的高质量数据对模型进行有监督训练,使模型更好地理解特定指令或任务格式。 强化学习:通过奖励模型对模型输出进行评价,引导模型生成更符合人类偏好的回答。 蒸馏:将大模型的能力迁移到更小的模型中,在保持性能的同时降低推理成本。 持续预训练:在特定领域的数据上继续预训练,增强模型在该领域的知识覆盖。 H3 Max所采用的后训练策略结合了监督微调和强化学习,针对图像理解和多轮对话两大场景进行了专项优化。...