改版通知

巨人肩膀网站已全新改版。若您仍依赖旧站功能或数据,欢迎联系我们,我们会协助处理。联系我们

AI大事件2025-01-15

梦想家2025年1月23日0 回答121 浏览

1、月之暗面Kimi多模态图片理解模型API发布

主要内容:

🖼️ Vision模型具备强大的图像识别能力,能够准确区分复杂细节和相似对象

📄 在OCR文字识别和图像理解方面表现优异,识别潦草手写内容的能力超越普通软件

💬 模型支持多轮对话和工具调用等特性,使用灵活,但不支持联网搜索


2、MiniMax开源MiniMax-01全新系列模型

主要内容:

🧠 MiniMax-01系列模型采用创新的线性注意力机制,打破传统架构局限,支持长达400万token的上下文处理

💡 该系列模型在多项任务上追平了GPT-4o和Claude-3.5-Sonnet,尤其在长文任务中表现优异

💰 MiniMax以业内最低价格提供文本和多模态理解API服务,标准定价为输入token1元/百万token,输出token8元/百万token


3、周鸿祎参演AI短剧开拍

主要内容:

🌟 短剧将在西安开机,计划春节上线,主题为穿越,预计60集

🤖 特效画面由纳米AI搜索生成,降低拍摄成本,提升视觉效果

📚 旨在普及AI知识,助力每个人掌握AI技术,消除数字鸿沟


4、阿里巴巴达摩院推出电商场景多模态大模型Valley 2

主要内容:

🌟 Valley2基于电商场景设计,采用Qwen2.5作为主干,结合SigLIP-384视觉编码器,提升多模态处理能力

📊 训练过程包括文本-视觉对齐和链式思维后训练,确保模型在复杂问题解决中的高效性

🏆 在多个公开基准测试中,Valley2表现卓越,尤其在电商领域的应用中超越同规模模型


5、ChatGPT智能体来了!上线“Tasks”功能

主要内容:

✅ 新功能“任务”允许用户安排未来的操作和提醒,提升ChatGPT的实用性

🔔 用户可通过简单输入告知ChatGPT所需任务及时间,轻松管理日常事务

💼 当前仅向付费用户推出,尚不明确是否会面向免费用户,预计仍将是高级功能


6、小型文本转语音模型Kokoro-TTS

主要内容:

🌟 Kokoro-82M是一款新发布的语音合成模型,具有8200万参数,支持多种语音包

🎤 该模型在TTS领域表现卓越,曾在排行榜上排名第一,仅用不到100小时的音频数据进行训练

📊 Kokoro模型的训练采用了开放许可证的数据,确保合规性,但目前仍存在一些功能限制


7、Topview AI推全球首个支持生成手拿产品的数字人Product Avatar

主要内容:

🤖 AI数字人可快速生成,无需真人模特,节省时间和成本

🌍 支持1000多种数字人模特和28种语言,满足全球市场需求

🎥 灵活高效的产品展示模式,商家可随时更换产品,提升推广效率


8、英伟达400万美投资MetAI

主要内容:

🌟 Nvidia投资400万美元于初创公司MetAI,推动AI数字双胞胎技术发展

🤖 MetAI利用AI和3D技术将CAD文件快速转换为功能性3D环境,缩短数字双胞胎创建时间

🚀 MetAI计划在2025年将总部迁至美国,并扩大研发团队以应对日益增长的市场需求


9、讯飞星火4.0 Turbo七大核心能力升级

主要内容:

🔢 数学能力显著提升,超越GPT-4o,能够处理复杂数学问题

💻 新推出的星火深度推理模型X1,拥有1750亿参数,适用于深层次数据分析

📈 科大讯飞自2020年以来累计研发投入125亿元,支持AI技术的持续发展


10、Gemini AI实现视觉处理新突破

主要内容:

🌟 Gemini AI实现实时视频与静态图像的同步处理,打破以往限制

🎨 AnyChat平台展示了AI在教育、艺术等领域的广泛应用潜力

🚀 开发者可以轻松利用Gemini的技术构建自己的视觉AI应用


11、科大讯飞星火同传语音大模型发布

主要内容:

🚀 星火同传语音大模型是国内首个具备端到端语音同传能力的大模型,显著提升了翻译效果

🌍 该模型在英译中方面几乎实现无延迟,适合国际展会和旅游等场景使用

⚡ 支持流式翻译和自适应语速调节,翻译的自然度和流畅度大幅提升,超越了国际同类技术


12、OpenBMB发布多模态模型MiniCPM-o2.6

主要内容:

🌟 MiniCPM-o2.6是一款具有80亿参数的多模态模型,能够在边缘设备上高效运行,支持视觉、语音和语言处理

🚀 该模型在OpenCompass基准测试中表现优异,视觉任务成绩超过GPT-4V,并具备多语言处理能力

🛠️ MiniCPM-o2.6具备实时处理、语音克隆和情感控制等功能,适用于教育、医疗等多个行业的创新应用