虽然大型语言模型(LLM)在文本生成方面展示了令人印象深刻的能力,但我们发现它们的能力尚未推广到音乐(人类的创造性语言)。
我们推出 ChatMusician,这是一个集成了内在音乐能力的开源LLM。它基于在文本兼容的音乐表示、ABC 表示法上对 LLaMA2 进行持续的预训练和微调,并且音乐被视为第二语言。ChatMusician 可以使用纯文本标记器理解和生成音乐,无需任何外部多模式神经结构或标记器。
有趣的是,赋予音乐能力并不会损害语言能力,甚至可以取得略高的 MMLU 分数。我们的模型能够根据文本、和弦、旋律、主题、音乐形式等创作结构良好的完整音乐,超越 GPT-4 基线。
在我们精心策划的大学级音乐理解基准测试 MusicTheoryBench 上,ChatMusician 在零样本设置上明显超越了 LLaMA2 和 GPT-3.5。我们的工作表明,LLM可以成为出色的音乐压缩器,但仍有大量领域有待征服。
我们在 GitHub 上发布了我们的 4B 代币音乐语言语料库 MusicPile、收集的 MusicTheoryBench、代码、模型和演示。
参考文献:
[1] ChatMusician: Understanding and Generating Music Intrinsically with LLM(通过LLM本质上理解和生成音乐)
[2] 论文:https://huggingface.co/papers/2402.16153
[3] 项目:https://shanghaicannon.github.io/ChatMusician/
[4] https://cdn-uploads.huggingface.co/production/uploads/60f1abe7544c2adfd699860c/WDMvwieajdGIJXfJ830Y0.mp4
好文章,需要你的鼓励
本文探讨新任 HHS 司长罗伯特·F·肯尼迪 Jr 可能推动 HIPAA 改革,重点关注加强医疗数据网络安全、提升隐私保护及监管措施,以应对日益严峻的网络威胁。
Fedora 42 正式登陆 WSL2 平台,虽配旧版内核,但保留了 Fedora 传统操作方式,与 Windows 深度集成,提供稳定容器化体验。
基于 Surfshark 对十大手机浏览器的研究,Chrome 共采集包括联系人、位置、浏览历史等 20 种数据,明显高于隐私友好的 Brave 和 Tor,这揭示了热门浏览器隐私风险。
RSAC 2025 传达了 agentic AI 正在提升网络防护效能,并推动企业利用自动化技术优化事件响应、保护 AI 模型,以及促使 CISO 上升至董事会层面,以应对日益复杂的安全威胁。