Selection notes, standards and plant updates.
-

Gemini Notebook支持导入已购Google Play电子书
2026年8月28日,Google宣布Gemini Notebook新增电子书导入功能,用户可直接将已购Google Play图书接入笔记工具,实现内容摘录、自动摘要与问答交互。这一功能的上线标志着Google正在将其AI能力与数字阅读生态进行深度融合,为用户打造从阅读到知识管理的全链路智能化体验。 Gemini Notebook产品背景 Gemini Notebook是Google推出的AI驱动型笔记与知识管理工具,最早在2025年作为Google Labs的实验性产品亮相。与Evernote、Notion、Obsidian等传统笔记工具不同,Gemini Notebook的核心差异化在于其深度集成了Google的Gemini大语言模型,用户可以在笔记工作流中随时调用AI能力进行文本处理、信息检索、内容生成和知识问答。 Gemini Notebook最初面向研究人员、学生和知识工作者设计,旨在解决信息过载时代的知识管理难题。用户可以在Notebook中创建多个项目(Project),每个项目可上传多种类型的资料,包括本地文档、网页链接、云端文件等。Gemini模型会对上传的资料进行自动索引和分析,用户随后可对这些资料进行提问、摘要和内容整合。 2026年以来,Gemini Notebook经历了多次功能迭代。2026年3月,Google为Notebook添加了来自Google Drive的云端支持,允许用户直接在Notebook中引用来自Drive的文档。2026年6月,Notebook引入了协作功能和共享记忆功能,使团队用户能够在同一项目中进行协作,并共享AI的上下文记忆。2026年8月,Notebook新增了对Google Workspace文档的更多支持,允许用户从Docs、Sheets、Slides中引用内容。而此次Google Play电子书导入功能的加入,使Gemini Notebook在“阅读-笔记-知识管理”这一完整链条上补上了关键的一环。 Google Play图书生态简介 Google Play图书是Google旗下的数字图书平台,用户可在该平台上购买和阅读电子书、有声书和漫画。Google Play图书拥有数百万册图书资源,覆盖文学、科技、商业、教育、学术等几乎所有领域。用户购买的图书可在Android、iOS、Web等多个平台上阅读,阅读进度、书签和笔记会在各设备间同步。 然而,Google Play图书长期以来的一个短板在于:用户在阅读过程中所做的摘录和笔记,难以导出或整合到其他知识管理工具中。用户如果想要将某本书中的重要内容引入自己的研究项目或工作文档,往往需要手动转录或截图,效率低下且容易出错。Gemini…
-

Google搜索AI Mode升级旅游规划功能
2026年8月28日,Google搜索的AI Mode功能强化了旅游规划场景,现可根据用户预算、时间与偏好,自动生成包含交通、住宿、景点的完整行程方案。Google搜索AI Mode简介Google搜索的AI Mode是Google将生成式AI功能整合到搜索引擎中的核心产品之一。AI Mode于2026年5月正式面向美国地区的搜索用户推出,随后逐步扩展到全球市场。AI Mode与传统的Google搜索体验不同,它采用了对话式的交互方式,用户可以用自然语言提出复杂的问题,AI Mode能够理解并回应用户的多轮追问,提供更加个性化和全面的答案。与Google此前推出的AI Overview(AI概览)功能相比,AI Mode提供了更深入、更交互式的搜索体验。旅游规划功能的升级内容此次升级,AI Mode在旅游规划方面的能力得到了显著增强:完整行程生成:用户只需输入目的地、旅行天数、预算范围和偏好类型(如文化、自然、美食、购物、冒险等),AI Mode即可自动生成优化后的每日行程安排。系统会综合考虑景点间的距离、开放时间、交通方式和合理休息时间,生成符合逻辑且可执行的行程。实时信息整合:AI Mode可深度调用Google生态内的数据资源,包括Google Maps的地理信息、Google Flights的航班数据、Google Hotels的住宿信息等。用户在规划过程中可获得实时的交通方案推荐、住宿价格比较和景点热度信息。个性化推荐:系统根据用户的历史搜索行为、位置记录和偏好数据,提供个性化的景点、餐厅和活动推荐。对于重复访问同一目的地的用户,AI Mode会优先推荐未体验过的新地点或当前热门的活动。动态调整:用户可在AI Mode中与系统进行对话式的调整,比如“我第一天不想太累,减少一个景点”或“我想增加一个博物馆参观”,系统会根据新的需求实时调整行程方案。预算优化:AI Mode可根据用户
-

Hugging Face发布开源双足机器人Microduck
2026年8月28日,Hugging Face推出开源双足机器人项目Microduck,提供完整的硬件图纸与控制算法,旨在降低足式机器人研发门槛,推动社区共创。 Hugging Face的机器人战略 Hugging Face是全球最大的AI开源社区平台,托管了数十万个AI模型和数据集。近年来,Hugging Face开始向机器人领域拓展,推出了LeRobot开源机器人库,旨在将AI领域的开源文化和协作模式引入机器人研发领域。 LeRobot库提供了机器人学习算法的参考实现、数据集和工具链,支持研究人员和开发者在机器人领域进行快速实验和创新。Microduck是LeRobot生态中的一个重要硬件项目。 Microduck的硬件设计 Microduck是一个完整的开源双足机器人项目,包括以下硬件组成部分: 硬件设计的模块化程度较高,用户可根据需要更换或升级特定部件,便于定制化和实验。 控制算法 Microduck的控制算法是其核心软件部分,主要包括: 控制算法的代码完全开源,采用Python和C++混合编程,便于研究人员理解和修改。 Microduck的技术亮点 开源理念 Microduck的开源理念体现在以下几个方面: 对机器人社区的意义 Microduck的开源具有以下重要意义: 与竞品对比 在开源足式机器人领域,Microduck的竞品包括: Microduck的差异化在于其专注于双足平台,且背靠Hugging Face强大的开源社区生态。
-

AISI发布开源工具optstop以动态优化LLM评估算力
2026年8月28日,AI安全机构AISI正式发布开源工具optstop,该工具可动态调整LLM评估过程中的计算资源分配,在保证评测质量的同时有效节省算力成本。 AISI简介 AISI(AI Safety Institute,AI安全研究所)是一家专注于AI安全研究的机构,致力于确保AI系统的安全、可靠和可控。AISI的研究方向包括AI对齐、鲁棒性评估、可解释性、AI安全治理等。 AISI此前曾发布多项与AI安全相关的研究成果和开源工具,包括AI系统安全性评估框架、模型鲁棒性测试工具等。optstop是其在“高效AI评估”领域的最新贡献。 LLM评估面临的挑战 随着大型语言模型在各类应用中的广泛部署,对模型能力的评估变得越来越重要。然而,LLM评估面临着几个关键挑战: optstop的核心机制 optstop的核心思想是在LLM评估过程中,根据任务的复杂度和当前模型的置信度动态决定是否继续分配算力: 成本效益与性能保障 通过智能截断机制,optstop可在不显著影响评估准确性的前提下实现可观的成本节省: 开源的意义 optstop以开源方式发布,这一决策具有多重意义: 应用场景 optstop可应用于多种LLM评估场景: 与竞品对比 在LLM高效评估领域,已有一些相关的工作和工具。optstop的独特之处在于:
-

阿里云百炼下调Qwen3.8-Flash模型价格
2026年8月28日,阿里云百炼平台正式宣布大幅下调Qwen3.8-Flash模型的调用价格,进一步降低中小开发者和企业使用大模型的门槛。 阿里云百炼平台简介 阿里云百炼是阿里巴巴集团旗下的一站式AI模型服务平台,提供模型训练、部署、调用和管理的全链路服务。百炼平台整合了阿里自研的通义系列模型(Qwen),以及第三方开源和商业模型,为开发者和企业提供了丰富的AI模型选择。 百炼平台的目标是降低AI技术的使用门槛,让更多的开发者和企业能够便捷地应用大模型技术。平台提供了标准化API、SDK、可视化开发工具和丰富的文档支持。 Qwen3.8-Flash模型介绍 Qwen3.8-Flash是阿里云通义系列中的轻量级高效模型,其设计理念是在保持较强性能的同时实现更低的推理成本。与其他通义模型相比,Qwen3.8-Flash具有以下特点: 价格调整详情 阿里云百炼宣布对Qwen3.8-Flash模型的API调用价格进行大幅下调。具体的价格调整方案包括: 虽然官方公告未披露具体数字,但业内人士分析,此次降价的幅度可能在20%-40%之间,具体因使用量和计费模式而异。新的价格体系已在阿里云百炼官方公告中公布,用户可登录阿里云控制台查看最新价格。 对开发者和企业的影响 此次降价对不同类型的用户具有不同的意义: 阿里云百炼的生态战略 此次降价体现了阿里云百炼的生态发展战略: 市场竞争格局 在AI模型API服务市场,阿里云百炼面临着来自以下方面的竞争: 在此竞争格局中,价格是用户选择平台的重要因素之一。阿里云百炼通过降价策略,在保持模型质量的同时提升价格竞争力,有望吸引更多价格敏感型用户。 降价背后的趋势 此次降价反映了AI大模型行业的几个重要趋势:
-

全新Qoder发布:推编程与通用双模式及桌面端
2026年8月28日,Qoder迎来全面升级,新增编程辅助与通用助手双模式切换,并同步推出桌面客户端,为用户提供更流畅的跨平台交互体验。 Qoder的产品定位 Qoder是一款AI辅助开发和工作效率工具,致力于帮助开发者和知识工作者在编程和日常工作中提高效率。与专注于特定场景的AI工具不同,Qoder的目标是在一个产品中覆盖从专业开发到日常办公的多种使用场景。 Qoder的竞争产品包括GitHub Copilot(专注于编程辅助)、ChatGPT(通用对话)、Cursor(AI驱动的代码编辑器)等。Qoder的差异化策略在于“双模式一体”的产品设计。 编程模式:深度集成开发工具链 Qoder的编程模式专为软件开发场景设计,提供以下核心能力: 编程模式深度集成了开发工具链,可与主流IDE(如VS Code、JetBrains系列)进行联动,支持上下文感知的代码补全和建议。 通用模式:覆盖广泛的日常场景 通用助手模式则覆盖日常问答、文本处理、创意写作等广泛场景: 两种模式之间支持一键切换。用户可根据当前任务的性质灵活选择合适的工作模式,无需在不同产品间切换。 桌面客户端:更流畅的跨平台体验 同步推出的桌面客户端支持Windows、macOS和Linux三大主流操作系统,提供了与网页版相比的独特优势: 对开发者的价值 Qoder的新版对开发者具有多重价值: 市场竞争格局 Qoder所在的AI辅助工具市场竞争激烈。主要竞争对手各有特色: Qoder的双模式策略使其在竞争中找到了一条差异化路径,既有编程辅助的专业深度,又有通用助手的广泛适用性。
-

Cohere发布文档解析模型Parse 5
2026年8月28日,Cohere正式推出文档解析模型Parse 5,专注于从复杂版式文档中精准提取信息,显著提升RAG系统对PDF与扫描件的处理质量。 Cohere公司简介 Cohere是一家专注于企业级AI应用的加拿大人工智能公司,由前Google研究人员创立。与OpenAI和Anthropic等专注于通用对话模型的公司不同,Cohere的重点在于为企业提供定制化的AI解决方案,特别是在检索增强生成(RAG)、文档理解和企业搜索等领域。 Cohere的产品矩阵包括: Parse 5的技术突破 Parse 5针对复杂版式文档的解析进行了专项优化,解决了传统文档解析工具的多个痛点: 在RAG系统中的作用 检索增强生成是一种将语言模型与外部知识库结合的技术架构。在RAG工作流中,文档解析质量直接影响后续的检索精度和生成效果。 Parse 5在RAG系统中的价值体现在: 应用场景广泛 Parse 5可应用于多个专业领域: Cohere Parse系列的发展 Parse 5是Cohere Parse系列的最新版本。此前的Parse 1至Parse 4分别在处理速度、识别精度和支持格式等方面实现了渐进式改进。Parse 5是这一系列中在复杂版式处理能力上的一次重大飞跃。…
-

BreezeBlue开源Breeze TTS 2语音模型
2026年8月28日,BreezeBlue团队正式宣布开源新一代语音合成模型Breeze TTS 2。该模型支持多语种、高自然度实时语音生成,开发者可免费下载模型权重进行本地部署。 BreezeBlue团队简介 BreezeBlue是一家专注于AI语音技术的研发团队,致力于推动语音合成、语音识别和语音交互技术的创新与普及。团队此前曾发布Breeze TTS 1.0,在开发者社区中获得了积极反响。Breeze TTS 2是团队在吸收了社区反馈和技术积累后推出的重要升级版本。 Breeze TTS 2的技术亮点 Breeze TTS 2在多个技术维度上实现了显著提升: 开源策略与技术生态 BreezeBlue选择以开源方式发布Breeze TTS 2,这一决策体现了团队推动语音技术普惠化的理念。开源带来的价值包括: 应用场景分析 Breeze TTS 2可应用于多种场景: 与竞品的对比…
-

Midjourney V8.2图像编辑模型开启测试
2026年8月28日,Midjourney官方宣布,V8.2图像编辑模型正式启动小范围测试。新版本在局部重绘、风格迁移及一致性保持等核心功能上实现了显著增强,测试资格已向部分订阅用户开放。 Midjourney的发展历程 Midjourney是由Midjourney公司开发的AI图像生成工具,自2022年首次推出以来,已成为AI艺术创作领域的代表性产品之一。与Stable Diffusion和DALL-E等其他AI图像生成工具相比,Midjourney以其独特的艺术风格和对细节的高度关注而闻名。 Midjourney的发展经历了多个版本的迭代: 局部重绘:精准修改的利器 局部重绘是V8.2最受关注的新功能之一。该功能允许用户选定图像的特定区域,通过文本提示对该区域进行精确修改,而图像的其余部分保持不变。 在技术实现上,V8.2的局部重绘采用了先进的图像分割和生成技术。当用户选定区域并输入修改提示后,模型会: 与V8.1相比,V8.2在局部重绘方面的提升主要体现在: 风格迁移:创意表达的延伸 风格迁移功能允许用户将参考图像的风格特征应用于目标图像,同时保持目标图像的内容完整性。V8.2在这方面实现了以下增强: 一致性保持:系列化创作的保障 一致性保持是V8.2的另一项核心增强,尤其对需要批量生成风格统一素材的创作者具有重要意义: 测试范围与开放计划 目前,V8.2的图像编辑功能仅向部分订阅用户开放测试。Midjourney官方未公布具体的测试用户筛选标准,但通常优先考虑活跃度高、使用历史长的订阅用户。 Midjourney的版本迭代通常遵循“小范围测试→逐步扩大→全量推送”的节奏。在测试阶段,用户可向官方反馈问题和建议,官方会根据反馈对功能进行调整和优化。预计在测试周期完成后,V8.2的图像编辑功能将向所有订阅用户开放。 市场竞争与行业影响 在AI图像生成领域,Midjourney面临着来自Stable Diffusion、DALL-E、Firefly等多个竞品的激烈竞争。各产品在功能上各有侧重: V8.2的图像编辑功能升级,使Midjourney在“生成后编辑”这一关键工作流环节上进一步巩固了竞争力。对于专业设计师和艺术家来说,能够在同一平台上完成从生成到编辑的全流程,提升了创作效率。