AI 图像生成器 Midjourney 今天发布了其时隔许久的首个新模型。这个被称为 V7 的模型是一次从零开始的重构,目前已向用户开放 alpha 测试版本。
V7 在两个方面有所改进:首先是更好的图像质量,其次是新的工具和工作流程。
在图像改进方面,V7 承诺在手部、手指、身体部位和"各类物体"方面提供更高的连贯性和一致性。同时还能呈现更加细致和逼真的纹理与材质效果,比如皮肤皱纹或陶瓷罐的细微特征。
这些细节通常是辨识图像是否由 AI 生成的最明显特征。需要明确的是,Midjourney 并不是声称已经取得了让 AI 图像完全无法被专业人士识别的突破;而是表示已经大幅改善了我们习以为常的一些瑕疵。
在功能方面,最大亮点是新增的"草稿模式"。Midjourney 在其各种用户沟通渠道 (博客、Discord、X 等) 上表示,"草稿模式的成本只有一半,渲染速度提高了 10 倍。"
不过,草稿模式生成的图像质量低于其他模式,因此并不适合用于生成最终成品。相反,它旨在帮助用户快速迭代和探索,找到理想效果后再切换到其他模式来生成适合公开使用的图像。
V7 提供两种模式:turbo 和 relax。Turbo 模式能快速生成最终图像,但信用点数消耗是两倍;而 relax 模式虽然处理时间较长,但只需要一半的成本。奇怪的是,V7 目前没有标准模式;Midjourney 表示这需要更多时间完善,将在后续推出。
V7 支持之前版本的大多数参数 (--ar、--seed 等),包括用户现有的 6.1 版本的 --sref 代码,以及最近推出的个性化功能。事实上,V7 是第一个默认启用个性化功能的 Midjourney 模型,这意味着用户需要选择至少 200 张图片来构建其美学偏好档案。
个性化功能会多次让用户在两张图片中进行选择,以此学习用户认为"美"的标准,从而根据这些品味定制生成内容。不过,和之前的模型一样,用户也可以选择在 V7 中关闭个性化功能。
Midjourney 是最早获得广泛应用的 AI 图像生成工具之一。最初它只能在 Discord 上使用,需要通过一些略显晦涩的语法操作,但现在已经推出了更现代化的网页界面。
社交媒体上分享的大量 AI 艺术作品都是通过 Discord 制作的。它也是许多 AI 视频创作者工作流程中的重要组成部分,他们通常先在 Midjourney 中创建初始图像,然后使用 Runway 等应用的图像转视频功能。
尽管非常受欢迎,Midjourney 仍面临多起诉讼,并卷入了一场持续的争论:使用网络上受版权保护的作品训练 AI 模型是否构成合理使用。(任何使用过 Midjourney 的人都知道它是用受版权保护的作品训练的;它有时甚至会在输出结果中生成水印和艺术家签名。)
最近,该公司宣布计划在未来推出硬件产品,但具体形式仍不明确。
好文章,需要你的鼓励
数据分析平台公司Databricks完成10亿美元K轮融资,公司估值超过1000亿美元,累计融资总额超过200亿美元。公司第二季度收入运营率达到40亿美元,同比增长50%,AI产品收入运营率超过10亿美元。超过650家客户年消费超过100万美元,净收入留存率超过140%。资金将用于扩展Agent Bricks和Lakebase业务及全球扩张。
Meta与特拉维夫大学联合研发的VideoJAM技术,通过让AI同时学习外观和运动信息,显著解决了当前视频生成模型中动作不连贯、违反物理定律的核心问题。该技术仅需添加两个线性层就能大幅提升运动质量,在多项测试中超越包括Sora在内的商业模型,为AI视频生成的实用化应用奠定了重要基础。
医疗信息管理平台Predoc宣布获得3000万美元新融资,用于扩大运营规模并在肿瘤科、研究网络和虚拟医疗提供商中推广应用。该公司成立于2022年,利用人工智能技术提供端到端平台服务,自动化病历检索并整合为可操作的临床洞察。平台可实现病历检索速度提升75%,临床审查时间减少70%,旨在增强而非替代临床判断。
上海AI实验室发布OmniAlign-V研究,首次系统性解决多模态大语言模型人性化对话问题。该研究创建了包含20万高质量样本的训练数据集和MM-AlignBench评测基准,通过创新的数据生成和质量管控方法,让AI在保持技术能力的同时显著提升人性化交互水平,为AI价值观对齐提供了可行技术路径。