AI 图像生成器 Midjourney 今天发布了其时隔许久的首个新模型。这个被称为 V7 的模型是一次从零开始的重构,目前已向用户开放 alpha 测试版本。
V7 在两个方面有所改进:首先是更好的图像质量,其次是新的工具和工作流程。
在图像改进方面,V7 承诺在手部、手指、身体部位和"各类物体"方面提供更高的连贯性和一致性。同时还能呈现更加细致和逼真的纹理与材质效果,比如皮肤皱纹或陶瓷罐的细微特征。
这些细节通常是辨识图像是否由 AI 生成的最明显特征。需要明确的是,Midjourney 并不是声称已经取得了让 AI 图像完全无法被专业人士识别的突破;而是表示已经大幅改善了我们习以为常的一些瑕疵。
在功能方面,最大亮点是新增的"草稿模式"。Midjourney 在其各种用户沟通渠道 (博客、Discord、X 等) 上表示,"草稿模式的成本只有一半,渲染速度提高了 10 倍。"
不过,草稿模式生成的图像质量低于其他模式,因此并不适合用于生成最终成品。相反,它旨在帮助用户快速迭代和探索,找到理想效果后再切换到其他模式来生成适合公开使用的图像。
V7 提供两种模式:turbo 和 relax。Turbo 模式能快速生成最终图像,但信用点数消耗是两倍;而 relax 模式虽然处理时间较长,但只需要一半的成本。奇怪的是,V7 目前没有标准模式;Midjourney 表示这需要更多时间完善,将在后续推出。
V7 支持之前版本的大多数参数 (--ar、--seed 等),包括用户现有的 6.1 版本的 --sref 代码,以及最近推出的个性化功能。事实上,V7 是第一个默认启用个性化功能的 Midjourney 模型,这意味着用户需要选择至少 200 张图片来构建其美学偏好档案。
个性化功能会多次让用户在两张图片中进行选择,以此学习用户认为"美"的标准,从而根据这些品味定制生成内容。不过,和之前的模型一样,用户也可以选择在 V7 中关闭个性化功能。
Midjourney 是最早获得广泛应用的 AI 图像生成工具之一。最初它只能在 Discord 上使用,需要通过一些略显晦涩的语法操作,但现在已经推出了更现代化的网页界面。
社交媒体上分享的大量 AI 艺术作品都是通过 Discord 制作的。它也是许多 AI 视频创作者工作流程中的重要组成部分,他们通常先在 Midjourney 中创建初始图像,然后使用 Runway 等应用的图像转视频功能。
尽管非常受欢迎,Midjourney 仍面临多起诉讼,并卷入了一场持续的争论:使用网络上受版权保护的作品训练 AI 模型是否构成合理使用。(任何使用过 Midjourney 的人都知道它是用受版权保护的作品训练的;它有时甚至会在输出结果中生成水印和艺术家签名。)
最近,该公司宣布计划在未来推出硬件产品,但具体形式仍不明确。
好文章,需要你的鼓励
英超联赛数字媒体和受众发展总监Alexandra Willis在访谈中分享了如何运用数据和AI技术为全球18亿球迷提供个性化体验。她强调通过与Adobe、微软等技术伙伴合作,构建客户数据平台和分析能力,帮助球迷创造个性化内容。Willis认为数字化转型的关键是平衡内部专业能力与外部合作伙伴的专长,确保技术创新与业务目标保持一致,为不同地区和兴趣的球迷提供有意义的数字化体验。
加利福尼亚大学和萨里大学研究团队开发了一种创新的AI系统,能够仅通过简单的手绘素描就在复杂照片中精确识别关键点。这项技术突破了传统机器学习需要大量同类数据的限制,实现了真正的跨模态学习。系统在动物关键点识别任务中达到了39%的准确率,超越现有方法约5个百分点,并且在真实手绘素描测试中表现稳定。该技术有望在生物学研究、医疗诊断、工业检测等多个领域找到广泛应用。
随着Windows 10即将停止支持,业界迫切需要一个简单可靠的免费操作系统,能让老旧PC轻松上网而无需Google账户。ChromeOS凭借"足够上网的Linux"理念获得数十亿用户,但开源世界却没有类似的替代品。ChromeOS采用不可变设计、双根分区更新机制,比现有Linux发行版更稳定。所有技术组件都已存在,关键是去除复杂性,打造一个能在15年内任何PC上运行的纯浏览器系统。
约翰霍普金斯大学发布DOTRESIZE技术,通过最优传输理论实现AI大模型智能压缩。该方法将相似神经元合并而非删除,在保持性能的同时显著降低计算成本。实验显示,压缩20%后模型仍保持98%性能,为AI技术普及和可持续发展提供新路径。