DeepSeek识图模式上线+阿里千问输入法曝光:大模型正在从”对话框”渗透到”操作系统”
6月19日IT早报同时出现了两条消息:DeepSeek识图模式正式上线,阿里被曝将推出”千问输入法”。看起来是两条不相关的产品更新,放在一起看却能看到同一个趋势:大模型不再满足于躲在聊天框后面,正在向用户交互的最底层渗透。这可能是2026年下半年AI产品竞争中最值得跟踪的暗线。
DeepSeek的识图模式意味着用户可以直接上传图片让模型”看懂”——从OCR文字提取(尤其是中文复杂排版中的表格和公式)、到图表数据解析、到医学影像初步判断、到工程设计图标注识别。这补上了DeepSeek此前纯文本交互的最大短板。值得一提的是,DeepSeek-OCR系列在中文文档识别精度上已经积累了行业口碑,尤其在表格还原和公式识别两个场景下表现突出,这得益于其独特的视觉编码技术——更接近人类”扫读+理解”的阅读逻辑。识图模式的交互化,本质上是把”OCR能力”升级为”视觉理解能力”,从”提取文字”到”理解图片在说什么”。
而阿里的”千问输入法”选择了一条更激进的路径——把大模型嵌入用户每天使用频次最高的入口。输入法市场长期被搜狗(腾讯)、百度、讯飞三足鼎立,但三家都是”传统输入法+AI辅助”的渐进式路线。千问输入法如果真正实现”AI原生”——打完一句话就自动润色、翻译、续写、纠错,用户不需要切换App、不需要唤起任何工具——那它的竞争逻辑就不是”更好的输入法”,而是”无处不在的AI助手”。输入法是操作系统之上最底层的应用入口之一,每天被调用上百次。如果能在这个位置上植入大模型能力,千人千面的个性化交互将不再是概念。
两条路径折射同一个行业共识:大模型的竞争已经从”谁的模型更强”转向了”谁的模型离用户更近”。对话框(ChatGPT/Gemini/豆包/元宝)是第一层入口,操作系统级集成(Apple Intelligence/千问输入法/DeepSeek识图)是第二层入口。第二层的竞争刚刚开始,但胜负可能决定了未来五年AI产品的格局。有趣的是,两家公司走了完全不同的技术路线:DeepSeek走的是”能力拓展”——让模型能处理更多模态的输入;阿里走的是”场景嵌入”——让模型住进用户每天都在用的工具里。哪种路线更有效?2027年回头看可能会有一个清晰的答案。
米哈游也加入了这场”AI渗透日常”的实验——其AI女友陪伴软件”林离Olivia”已上架Steam,支持MIDI上传生成音乐视频和桌面动态壁纸。从打游戏到养AI女友,大模型正在占领年轻人的每一个屏幕。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
