负责AIoT边缘端低功耗AI推理芯片的全生命周期架构设计,统筹性能(TOPS)、功耗(mW)、面积(mm²)(PPA)指标落地,协同算法、前端、验证团队完成从架构定义到 Tape-out 前的验证闭环,支撑消费级智能硬件客户的产品落地
- 主导面向智能摄像头场景的低功耗AI推理芯片架构设计,基于Synopsys ArchVision工具开展多维度架构探索——针对边缘场景“实时性(≤10ms延迟)+ 极致功耗(≤50mW)”的矛盾,创新性提出“CNN-Tensor Core异构计算单元+动态电压频率调整(DVFS)+ 指令级稀疏化加速”架构:将轻量级CNN任务分配至低功耗MCU核,复杂Transformer任务调度至专用Tensor Core,结合任务负载预测算法动态调整核电压(0.8V-1.2V);最终芯片在ResNet-50推理任务中功耗较竞品降低35%,延迟满足实时性要求,支撑客户智能摄像头产品量产50万台
- 为解决多算法框架(TensorFlow Lite、PyTorch Mobile)适配痛点,基于Chisel语言设计参数化指令集扩展框架,抽象出“算子映射层+内存管理层”通用接口,允许算法团队通过配置文件快速适配新模型;相比传统RTL适配方式,算法导入周期从8周缩短至3周,支撑客户快速迭代智能检测算法(如人体姿态识别、宠物行为分析)
- 协同验证团队开展架构级事务级建模(TLM),使用SystemC搭建总线与存储子系统的虚拟原型,提前识别“AXI-Lite总线带宽瓶颈”——原设计中NPU与DDR的访存冲突导致利用率仅60%;通过拆分指令总线与数据总线、引入缓存一致性协议(ACE),优化后总线利用率提升至85%,验证周期缩短20%
- 主导芯片架构的可靠性设计,针对工业级温度范围(-40℃~85℃)下的时序收敛问题,采用Synopsys PrimeTime PX进行跨温度域时序分析,通过调整关键路径的缓冲器插入策略,将时序违例率从12%降至0.5%,确保芯片在极端环境下的稳定运行